arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型对齐与安全

大模型对齐、安全、越狱、红队、提示注入和可信评测。

2026-02-03 至 2026-02-03 共收录 14 信号源:cs.CL, cs.AI, cs.CY, cs.LG

1. 偏好对齐 14 篇

2602.00426 2026-02-03 cs.LG cs.AI cs.CL eess.SP 87%

LLMs as High-Dimensional Nonlinear Autoregressive Models with Attention: Training, Alignment and Inference

基于注意力机制的高维非线性自回归模型:训练、对齐与推理

Vikram Krishnamurthy

机构 * Cornell University(康奈尔大学)

专题命中 偏好对齐 :alignment(title,abstract);RLHF(abstract);DPO(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文将LLMs表述为具有注意力依赖的高维非线性自回归模型,探讨了训练、对齐与推理的原理及方法。

Comments 27 pages, 12 figures. Mathematical survey framing LLMs as high-dimensional nonlinear autoregressive models with attention, covering training, alignment, and inference, with nanoGPT/nanochat-style code examples. Feedback welcome

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.01128 2026-02-03 cs.LG 85%

Tangent Space Fine-Tuning for Directional Preference Alignment in Large Language Models

切线空间微调用于大语言模型中的方向偏好对齐

Mete Erdogan

机构 * Stanford University(斯坦福大学)

专题命中 偏好对齐 :alignment(title,abstract);DPO(abstract);safety(abstract);分类 cs.LG

AI总结 TS-DPO通过切线空间微调实现多偏好维度的可控对齐,提升模型在帮助性与冗余性之间的平衡能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.06876 2026-02-03 cs.CL cs.AI cs.LG 85%

Mix Data or Merge Models? Balancing the Helpfulness, Honesty, and Harmlessness of Large Language Model via Model Merging

混合数据还是融合模型?通过模型融合平衡大型语言模型的有用性、诚实性和无害性

Jinluan Yang, Dingnan Jin, Anke Tang, Li Shen, Didi Zhu, Zhengyu Chen, Ziyu Zhao, Daixin Wang, Qing Cui, Zhiqiang Zhang, Jun Zhou, Fei Wu, Kun Kuang

专题命中 偏好对齐 :harmlessness(title,abstract);alignment(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文提出RESM方法,通过改进的参数融合策略提升大型语言模型在有用性、诚实性和无害性方面的平衡对齐效果。

Comments arxiv version of NeurIPS2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.01002 2026-02-03 cs.AI 79%

How RLHF Amplifies Sycophancy

如何通过RLHF放大阿谀行为

Itai Shapira, Gerdus Benade, Ariel D. Procaccia

机构 * harvard(哈佛大学)

专题命中 偏好对齐 :RLHF(title);alignment(abstract);分类 cs.AI

AI总结 本文研究了RLHF如何通过放大机制增强阿谀行为,提出了一种训练干预措施以减少这种偏差。

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.04832 2026-02-03 cs.LG 79%

Discrete Diffusion Trajectory Alignment via Stepwise Decomposition

通过分步分解实现离散扩散轨迹对齐

Jiaqi Han, Austin Wang, Minkai Xu, Wenda Chu, Meihua Dang, Haotian Ye, Huayu Chen, Yisong Yue, Stefano Ermon

机构 * Stanford University(斯坦福大学) Caltech(加州理工学院) Tsinghua University(清华大学)

专题命中 偏好对齐 :alignment(title,abstract);分类 cs.LG

AI总结 本研究提出一种离线偏好优化方法,通过分步分解实现离散扩散模型的轨迹对齐,提升DNA序列设计和语言建模的性能。

Comments ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.01581 2026-02-03 cs.LG 74%

Nearly Optimal Active Preference Learning and Its Application to LLM Alignment

近优主动偏好学习及其在大语言模型对齐中的应用

Yao Zhao, Kwang-Sung Jun

机构 * University of Arizona(亚利桑那大学) Department of Computer Science(计算机科学系)

专题命中 偏好对齐 :alignment(title);分类 cs.LG

AI总结 本文提出两种主动学习算法,通过实例依赖标签复杂性保证和贪心方法提升大语言模型对齐的样本效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.23096 2026-02-03 cs.LG 70%

CATTO: Balancing Preferences and Confidence in Language Models

CATTO: 在语言模型中平衡偏好与信心

Nisarg Parikh, Ananya Sai, Pannaga Shivaswamy, Kunjal Panchal, Andrew Lan

机构 * Adobe

专题命中 偏好对齐 :alignment(abstract);DPO(abstract);分类 cs.LG

AI总结 CATTO通过校准意识的标记级训练目标,在保持任务准确性的同时,有效提升语言模型预测信心,减少校准误差,提高输出选择的可靠性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.00954 2026-02-03 cs.AI 70%

Small-Margin Preferences Still Matter-If You Train Them Right

小边距偏好依然重要-如果你训练得当的话

Jinlong Pang, Zhaowei Zhu, Na Di, Yichi Zhang, Yaxuan Wang, Chen Qian, Yang Liu

机构 * University of California, Santa Cruz(加州大学圣克鲁兹分校) Northeastern University(东北大学) DIMACS, Rutgers University(Rutgers大学DIMACS研究中心)

专题命中 偏好对齐 :alignment(abstract);DPO(abstract);分类 cs.AI

AI总结 本文提出MixDPO,一种基于难度的训练策略,通过课程学习和混合目标优化,提升LLM在模糊配对上的对齐效果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.00603 2026-02-03 cs.LG 70%

Direct Preference Optimization with Rating Information: Practical Algorithms and Provable Gains

直接偏好优化与评分信息:实用算法和可证明的收益

Luca Viano, Ruida Zhou, Yifan Sun, Mahdi Namazifar, Volkan Cevher, Shoham Sabach, Mohammad Ghavamzadeh

机构 * EPFL(苏黎世联邦理工学院) Amazon AGI(亚马逊人工智能实验室) University of Illinois at Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) Cornell University(康奈尔大学) Qualcomm AI Research(高通人工智能研究)

专题命中 偏好对齐 :alignment(abstract);DPO(abstract);分类 cs.LG

AI总结 本文提出利用评分间隙信息改进直接偏好优化算法,通过理论证明和实验验证,在准确评分间隙条件下实现更快的统计速率,并在多种LLM和基准上表现优异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.01068 2026-02-03 cs.CL cs.AI 62%

From Utterance to Vividity: Training Expressive Subtitle Translation LLM via Adaptive Local Preference Optimization

从话语到生动性:通过自适应局部偏好优化训练表达性字幕翻译LLM

Chaoqun Cui, Shijing Wang, Liangbin Huang, Qingqing Gu, Zhaolong Huang, Xiao Zeng, Wenji Mao

机构 * MAIS, Institute of Automation, Chinese Academy of Sciences(自动化研究所,中国科学院) School of Artificial Intelligence, University of Chinese Academy of Sciences(中国科学院大学人工智能学院) Hujing Digital Media & Entertainment Group(华景数字媒体与娱乐集团) Geely AI lab(吉利AI实验室)

专题命中 偏好对齐 :alignment(abstract);分类 cs.CL、cs.AI

AI总结 本研究提出ALPO方法,通过构建多方向字幕语料库,优化翻译LLM的表达性和生动性,提升翻译质量的多维评估性能。

Comments Accepted to ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.02341 2026-02-03 cs.CL cs.AI 62%

DRIFT: Learning from Abundant User Dissatisfaction in Real-World Preference Learning

DRIFT:从现实世界偏好学习中学习大量用户不满

Yifan Wang, Bolian Li, Junlin Wu, Zhaoxuan Tan, Zheli Liu, Ruqi Zhang, Ananth Grama, Qingkai Zeng

专题命中 偏好对齐 :DPO(abstract);分类 cs.CL、cs.AI

AI总结 DRIFT通过利用现实世界中的用户不满信号,提升大语言模型的偏好学习性能,实现更高的任务得分和胜率,优于现有方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.01137 2026-02-03 cs.LG 57%

Self-Generative Adversarial Fine-Tuning for Large Language Models

自生成对抗微调用于大语言模型

Shiguang Wu, Yaqing Wang, Quanming Yao

机构 * Department of Electronic Engineering, Tsinghua University(清华大学电子工程系) Beijing Institute of Mathematical Sciences and Applications(北京数学科学研究院)

专题命中 偏好对齐 :alignment(abstract);分类 cs.LG

AI总结 本文提出SGALM,通过生成对抗游戏实现大语言模型的对齐微调,无需外部奖励模型,达到最先进的性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.20668 2026-02-03 cs.CL 57%

PIRA: Preference-Oriented Instruction-Tuned Reward Models with Dual Aggregation

PIRA:基于双聚合的偏好导向指令调优奖励模型

Yongfu Xue

专题命中 偏好对齐 :alignment(abstract);分类 cs.CL

AI总结 PIRA通过整合三种策略,利用LLM的偏好指令能力,提升奖励模型的鲁棒性和泛化能力,有效缓解奖励过度优化问题。

Comments Accepted to EACL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.16142 2026-02-03 cs.CL 57%

RLKD: Distilling LLMs' Reasoning via Reinforcement Learning

通过强化学习蒸馏LLM的推理能力:RLKD

Shicheng Xu, Liang Pang, Yunchang Zhu, Jia Gu, Zihao Wei, Jingcheng Deng, Feiyang Pan, Huawei Shen, Xueqi Cheng

机构 * State Key Laboratory of AI Safety, Institute of Computing Technology, CAS(人工智能安全国家重点实验室,计算技术研究所,中国科学院) University of Chinese Academy of Sciences(中国科学院大学) Huawei Inc.(华为公司)

专题命中 偏好对齐 :alignment(abstract);分类 cs.CL

AI总结 RLKD通过强化学习和生成结构奖励模型,有效蒸馏LLM的多分支推理结构,提升学生模型的推理能力。

Comments 15 pages

详情

展开后加载摘要…

URL PDF HTML 收藏