arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型对齐与安全

大模型对齐、安全、越狱、红队、提示注入和可信评测。

2025-12-30 至 2025-12-30 共收录 2 信号源:cs.CL, cs.AI, cs.CY, cs.LG

1. AI治理与伦理 2 篇

2512.22725 2025-12-30 cs.CL cs.CY 62%

Mitigating Social Desirability Bias in Random Silicon Sampling

在随机硅采样中缓解社会可取性偏差

Sashank Chapala, Maksym Mironov, Songgaojun Deng

机构 * Eindhoven University of Technology(埃因霍温理工大学)

专题命中 AI治理与伦理 :alignment(abstract);分类 cs.CL、cs.CY

AI总结 本研究通过提示工程方法减轻LLM中的社会可取性偏差,提升硅样本与人类数据的一致性。

Comments 31 pages, 9 figures, and 24 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.23430 2025-12-30 cs.CL 57%

C2PO: Diagnosing and Disentangling Bias Shortcuts in LLMs

C2PO:诊断和解构大语言模型中的偏见捷径

Xuan Feng, Bo An, Tianlong Gu, Liang Chang, Fengrui Hao, Peipeng Yu, Shuai Zhao

机构 * Jinan University(济南大学) Nanyang Technological University(南洋理工大学) Engineering Research Center of Trustworthy AI (Ministry of Education)(可信人工智能工程研究中心) Guangxi Key Laboratory of Trusted Software(广西可信软件重点实验室)

专题命中 AI治理与伦理 :alignment(abstract);分类 cs.CL

AI总结 C2PO通过因果对比偏好优化框架,解决大语言模型中的偏见问题,同时保持推理能力。

详情

展开后加载摘要…

URL PDF HTML 收藏