arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型对齐与安全

大模型对齐、安全、越狱、红队、提示注入和可信评测。

2026-02-13 至 2026-02-13 共收录 8 信号源:cs.CL, cs.AI, cs.CY, cs.LG

1. 偏好对齐 8 篇

2510.05703 2026-02-13 cs.LG 89%

Provably Convergent Primal-Dual DPO for Constrained LLM Alignment

可证明收敛的约束语言模型对齐的对偶直接偏好优化

Yihan Du, Seo Taek Kong, R. Srikant

机构 * SUTD ESD(新加坡科技设计大学电子与计算机工程系) UIUC ECE(伊利诺伊大学厄巴纳-香槟分校电子与计算机工程系)

专题命中 偏好对齐 :alignment(title,abstract);DPO(title,abstract);safety(abstract);分类 cs.LG

AI总结 本文提出了一种可证明收敛的约束LLM对齐方法,通过改进的DPO技术减少训练模型数量和内存消耗,同时保证约束条件和优化性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.12158 2026-02-13 cs.LG 88%

SafeNeuron: Neuron-Level Safety Alignment for Large Language Models

SafeNeuron: 大语言模型的神经层面安全对齐

Zhaoxin Wang, Jiaming Liang, Fengbin Zhu, Weixiang Zhao, Junfeng Fang, Jiayi Ji, Handing Wang, Tat-Seng Chua

机构 * Xidian University, Xi'an, China(西安电子科技大学) Harbin Institute of Technology, Harbin, China(哈尔滨工业大学) National University of Singapore,Singapore(新加坡国立大学)

专题命中 偏好对齐 :alignment(title,abstract);safety(title,abstract);分类 cs.LG

AI总结 SafeNeuron通过神经层面安全对齐框架提升模型鲁棒性,减少攻击风险并保持通用能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.11180 2026-02-13 cs.CL 83%

Mechanistic Interpretability for Large Language Model Alignment: Progress, Challenges, and Future Directions

大语言模型对齐的机制可解释性:进展、挑战与未来方向

Usman Naseem

机构 * Macquarie University(麦考瑞大学)

专题命中 偏好对齐 :alignment(title,abstract);RLHF(abstract);分类 cs.CL

AI总结 本文探讨了大语言模型对齐中机制可解释性的进展与挑战,提出未来研究方向,包括自动化可解释性、跨模型泛化和可解释性驱动的对齐技术。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.12180 2026-02-13 cs.LG cs.GT 79%

How Sampling Shapes LLM Alignment: From One-Shot Optima to Iterative Dynamics

采样如何塑造大语言模型对齐:从单次最优到迭代动态

Yurong Chen, Yu He, Michael I. Jordan, Fan Yao

机构 * Inria(法国国家信息与自动化研究所) École Normale Supérieure(巴黎高等师范学校) PSL Research University(巴黎综合理工研究所) Northwestern University(西北大学) University of California, Berkeley(加州大学伯克利分校) University of North Carolina at Chapel Hill(北卡罗来纳大学教堂山分校)

专题命中 偏好对齐 :alignment(title,abstract);分类 cs.LG

AI总结 研究探讨了采样对大语言模型对齐的影响,发现适当采样可提升排序保证,而偏向采样可能导致集中问题,并分析了迭代动态中的稳定性问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.11753 2026-02-13 cs.HC 78%

Building Intelligent User Interfaces for Human-AI Alignment

构建智能用户界面以实现人机对齐

Danqing Shi

专题命中 偏好对齐 :alignment(title,abstract)

AI总结 本文提出参考模型,通过分析用户界面改进人机对齐,展示两个案例研究和六个界面的初步调查,强调人机交互对对齐的促进作用。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.11902 2026-02-13 cs.LG cs.AI 73%

Mitigating Mismatch within Reference-based Preference Optimization

缓解基于参考的偏好优化中的不匹配

Suqin Yuan, Xingrui Yu, Jiyang Zheng, Lei Feng, Dadong Wang, Ivor Tsang, Tongliang Liu

机构 * Sydney AI Centre, The University of Sydney(悉尼人工智能中心,悉尼大学) CFAR, A*STAR(CFAR,A*STAR) CSIRO, Data61(CSIRO,Data61) Southeast University(东南大学) Nanyang Technological University(南洋理工大学)

专题命中 偏好对齐 :alignment(abstract);DPO(abstract);分类 cs.AI、cs.LG

AI总结 HyPO通过有条件地去偏参考信号缓解基于参考的偏好优化中的不匹配问题,提升推理对齐性能。

Comments Accepted by ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.01511 2026-02-13 cs.CL cs.LG 62%

Alternating Reinforcement Learning for Rubric-Based Reward Modeling in Non-Verifiable LLM Post-Training

交替强化学习用于非可验证大语言模型后训练的评分标准建模

Ran Xu, Tianci Liu, Zihan Dong, Tony Yu, Ilgee Hong, Carl Yang, Linjun Zhang, Tao Zhao, Haoyu Wang

机构 * Emory University(埃默里大学) Purdue University(普渡大学) Rutgers University(罗格斯大学) Georgia Institute of Technology(佐治亚理工学院) University at Albany(阿尔巴尼大学)

专题命中 偏好对齐 :alignment(abstract);分类 cs.CL、cs.LG

AI总结 Rubric-ARM通过交替强化学习优化评分标准生成与评判,提升非可验证领域大语言模型后训练的响应质量评估与策略对齐性能。

Comments The first two authors contributed equally

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.12116 2026-02-13 cs.CL 57%

P-GenRM: Personalized Generative Reward Model with Test-time User-based Scaling

P-GenRM:具有测试时用户基于缩放的个性化生成奖励模型

Pinyi Zhang, Ting-En Lin, Yuchuan Wu, Jingyang Chen, Zongqi Wang, Hua Yang, Ze Xu, Fei Huang, Kai Zhang, Yongbin Li

机构 * Alibaba Group(阿里巴巴集团)

专题命中 偏好对齐 :alignment(abstract);分类 cs.CL

AI总结 P-GenRM通过测试时用户基于缩放机制,实现个性化生成奖励模型,提升用户偏好适应性和泛化能力。

Comments Accepted as ICLR 2026 Oral

详情

展开后加载摘要…

URL PDF HTML 收藏