arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型对齐与安全

大模型对齐、安全、越狱、红队、提示注入和可信评测。

共收录 3261 信号源:cs.CL, cs.AI, cs.CY, cs.LG

1. 偏好对齐 3261 篇

2404.00934 2024-04-04 cs.CL 83%

ChatGLM-RLHF: Practices of Aligning Large Language Models with Human Feedback

Zhenyu Hou, Yilin Niu, Zhengxiao Du, Xiaohan Zhang, Xiao Liu, Aohan Zeng, Qinkai Zheng, Minlie Huang, Hongning Wang, Jie Tang, Yuxiao Dong

专题命中 偏好对齐 :RLHF(title,abstract);alignment(abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2403.16649 2024-03-27 cs.AI 83%

CLHA: A Simple yet Effective Contrastive Learning Framework for Human Alignment

Feiteng Fang, Liang Zhu, Min Yang, Xi Feng, Jinchang Hou, Qixuan Zhao, Chengming Li, Xiping Hu, Ruifeng Xu

专题命中 偏好对齐 :alignment(title,abstract);RLHF(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2311.00168 2024-02-05 cs.LG 83%

The Alignment Ceiling: Objective Mismatch in Reinforcement Learning from Human Feedback

Nathan Lambert, Roberto Calandra

专题命中 偏好对齐 :alignment(title);RLHF(abstract);safety(abstract);分类 cs.LG

Comments 11 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2312.15241 2023-12-27 cs.AI cs.IR 83%

Measuring Value Alignment

Fazl Barez, Philip Torr

专题命中 偏好对齐 :alignment(title,abstract);safety(abstract);分类 cs.AI

Comments arXiv admin note: text overlap with arXiv:2110.09240 by other authors

Journal ref NeurIPS 2023 MP2 Workshop

详情

展开后加载摘要…

URL PDF HTML 收藏
2312.07551 2023-12-14 cs.CL 83%

Language Model Alignment with Elastic Reset

Michael Noukhovitch, Samuel Lavoie, Florian Strub, Aaron Courville

专题命中 偏好对齐 :alignment(title,abstract);RLHF(abstract);分类 cs.CL

Comments Published at NeurIPS 2023

详情

展开后加载摘要…

URL PDF HTML 收藏
2310.11564 2023-10-19 cs.CL 83%

Personalized Soups: Personalized Large Language Model Alignment via Post-hoc Parameter Merging

Joel Jang, Seungone Kim, Bill Yuchen Lin, Yizhong Wang, Jack Hessel, Luke Zettlemoyer, Hannaneh Hajishirzi, Yejin Choi, Prithviraj Ammanabrolu

专题命中 偏好对齐 :alignment(title,abstract);RLHF(abstract);分类 cs.CL

Comments Preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2309.14525 2023-09-27 cs.CV cs.CL 83%

Aligning Large Multimodal Models with Factually Augmented RLHF

Zhiqing Sun, Sheng Shen, Shengcao Cao, Haotian Liu, Chunyuan Li, Yikang Shen, Chuang Gan, Liang-Yan Gui, Yu-Xiong Wang, Yiming Yang, Kurt Keutzer, Trevor Darrell

专题命中 偏好对齐 :RLHF(title,abstract);alignment(abstract);分类 cs.CL

Comments Preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2406.18629 2024-06-28 cs.LG cs.AI cs.CL 83%

Step-DPO: Step-wise Preference Optimization for Long-chain Reasoning of LLMs

Xin Lai, Zhuotao Tian, Yukang Chen, Senqiao Yang, Xiangru Peng, Jiaya Jia

专题命中 偏好对齐 :DPO(title,abstract);分类 cs.CL、cs.AI、cs.LG

Comments Code, data, and models are available at https://github.com/dvlab-research/Step-DPO

详情

展开后加载摘要…

URL PDF HTML 收藏
2406.15890 2024-06-25 cs.LG cs.AI cs.CL cs.GT 83%

Language Alignment via Nash-learning and Adaptive feedback

Ari Azarafrooz, Farshid Faal

专题命中 偏好对齐 :alignment(title,abstract);分类 cs.CL、cs.AI、cs.LG

Comments Accepted at ICML 2024 Workshop on Models of Human Feedback for AI Alignment, Vienna, Austria

详情

展开后加载摘要…

URL PDF HTML 收藏
2310.05910 2024-04-11 cs.CL cs.AI cs.LG 83%

SALMON: Self-Alignment with Instructable Reward Models

Zhiqing Sun, Yikang Shen, Hongxin Zhang, Qinhong Zhou, Zhenfang Chen, David Cox, Yiming Yang, Chuang Gan

专题命中 偏好对齐 :alignment(title,comments);RLHF(abstract);分类 cs.CL、cs.AI、cs.LG

Comments Previous Title: SALMON: Self-Alignment with Principle-Following Reward Models. Accepted to ICLR 2024. Project page: https://github.com/IBM/SALMON

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.21860 2026-08-25 cs.LG cs.AI 新提交 82%

ChainPrune: Evaluating and Reducing Redundancy in Long Chain-of-Thought Reasoning

ChainPrune:评估与减少长思维链推理中的冗余

Weihang Pan, Zhengxu Yu, Yuxiang Zhang, Wenzhi Li, Zhongming Jin, Binbin Lin, Xiaofei He, Jieping Ye

机构 * Alibaba Group(阿里巴巴集团)

专题命中 偏好对齐 :DPO(summary_cn,abstract);分类 cs.AI、cs.LG

AI总结 ChainPrune 是一种推理路径语义结构优化方法,通过整合推理路径为树结构、选择主导路径及结合 DPO 与监督损失,减少长思维链冗余,在保精度的同时降低了步骤长度与计算开销。

Comments 15 pages, 12 figures, 4 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.20099 2026-08-21 cs.MA cs.CL cs.LG 新提交 82%

Reward-Guided Autoregressive Graph Generation for Efficient Multi-Agent Communication Topology Design

奖励引导自回归图生成的高效多智能体通信拓扑设计

Poomphob Suwannapichat, Boonyarit Changaival, Caesar Wu, Pascal Bouvry

专题命中 偏好对齐 :RLHF(summary_cn,abstract);分类 cs.CL、cs.LG

AI总结 针对多智能体系统通信拓扑设计中 token 消耗过高的问题,本文提出 RGA-Designer 方法,通过结合 RLHF 训练奖励模型微调图生成器,在保持任务准确率的同时降低了 token 消耗。

Comments Full version of extended abstract accepted at ICONIP 2026 (poster)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.12192 2026-08-13 cs.AI cs.LG 新提交 82%

How to Spend Your Oracle Budget: Practical Guidance for Protein Structure Prediction Models

如何使用你的专家预算:蛋白质结构预测模型的实用指南

Aleksandra Kalisz, Jack Simons, Krisztina Sinkovics, Noam Ghenassia, Shikha Surana, Henry Moss, Paul Duckworth

机构 * InstaDeep Ltd(InstaDeep公司) University of Oxford(牛津大学) Lancaster University(兰卡斯特大学)

专题命中 偏好对齐 :DPO(summary_cn,abstract);分类 cs.AI、cs.LG

AI总结 本研究针对蛋白质结构预测模型的专家预算约束,通过基准测试FK-steering、DPO、Best K-of-N采样及O3方法,明确不同预算下的最优方法并给出实用选择建议。

Comments Proceedings of the ICML 2026 Workshop on Structured Probabilistic Inference & Generative Modeling (SPIGM)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.12062 2026-08-13 cs.CL cs.AI 新提交 82%

Preference Tree Optimization: Enhancing Goal-Oriented Dialogue with Look-Ahead Simulations

偏好树优化:通过前瞻模拟增强面向目标的对话

Lior Baruch, Moshe Butman, Kfir Bar, Doron Friedman

机构 * Reichman University(赖希曼大学) School of Computer Science(计算机科学学院) School of Communications(传播学院)

专题命中 偏好对齐 :DPO(summary_cn,abstract);分类 cs.CL、cs.AI

AI总结 本研究提出偏好树优化(PTO)框架,结合带前瞻的偏好树与直接偏好优化(DPO),在动机访谈领域通过虚拟患者等模拟对话生成偏好数据,训练的对话智能体在关键指标上优于基线。

Comments 13 pages, 4 figures. Accepted at an ICLR 2025 workshop

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.11573 2026-08-13 cs.CL cs.AI 新提交 82%

Reinforcing Step-level Reasoning for Effective Self-Correction in LLMs

强化步骤级推理以实现大语言模型的有效自校正

Vu Duc Anh, Nhat M. Hoang, Do Xuan Long, Cong-Duy Nguyen, Ponhvoan Srey, Luu Anh Tuan

机构 * Nanyang Technological University(南洋理工大学) National University of Singapore(新加坡国立大学) VinUniversity Institute for Infocomm Research (IR), A*STAR(新加坡科技研究局信息通信研究院)

专题命中 偏好对齐 :DPO(summary_cn,abstract);分类 cs.CL、cs.AI

AI总结 针对大语言模型自校正的核心挑战,提出SFS-DPO及教师辅助变体SFS-DPO-R框架,经多模型多域评估,其性能优于现有步骤级训练基线,可提升自校正频率与有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.02951 2026-08-05 cs.LG cs.AI 新提交 82%

SP3O: Reinforcement Learning from Segment Preferences without Reward Modeling

SP3O:无需奖励建模的分段偏好强化学习

Evan Assmus, Qining Zhang, Lei Ying

机构 * University of Michigan(密歇根大学)

专题命中 偏好对齐 :RLHF(abstract,abstract_cn);DPO(abstract,abstract_cn);分类 cs.AI、cs.LG

AI总结 SP3O是一种无需奖励建模的新型PbRL算法,利用分段级偏好反馈,通过PPO型损失函数优化策略,在机器人控制和LLM微调等长视界任务中性能优于现有算法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.02302 2026-08-04 cs.AI cs.LG cs.SE 新提交 82%

Trajectories That Segment Themselves: Agent-Declared Boundaries as a Training Unit

自分割轨迹:智能体声明边界作为训练单元

Jingxi Wei

专题命中 偏好对齐 :DPO(summary_cn,abstract);分类 cs.AI、cs.LG

AI总结 该研究提出智能体声明边界的采集时语义自分割方法,将其作为训练单元,实验表明该分段具有一致性,下游DPO在特定任务中表现优于对照组。

Comments 20 pages, 6 figures, 11 tables. Includes appendices with full controls and ablations

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.13712 2026-07-16 cs.CV cs.AI cs.CL cs.MM 新提交 82%

Groc-PO: Grounded Context Preference Optimization for Truthful Multimodal LLMs

Groc-PO:用于真实多模态大语言模型的基于上下文的偏好优化

Zhixiao Zheng, Zheren Fu, Zhiyuan Yao, Chunxiao Liu, Dongming Zhang, Zhendong Mao

机构 * University of Science and Technology of China(中国科学技术大学) Xiaomi Corporation(小米公司) State Key Laboratory of Communication Content Cognition, People’s Daily Online(人民日报社传播内容认知国家重点实验室)

专题命中 偏好对齐 :DPO(abstract,abstract_cn);alignment(abstract);trustworthy(abstract);分类 cs.CL、cs.AI

AI总结 研究针对多模态大语言模型的不真实问题,提出基于上下文的偏好优化框架Groc-PO,构建相关数据集,通过多阶段偏好样本捕捉基础上下文,加强上下文相关推理,减轻跨阶段错误传播,提升模型性能。

Comments Accepted by ACM-MM 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.10494 2026-07-07 cs.CL cs.LG 版本更新 82%

Coverage-Controlled Preference Mining from Noisy Claim Verification for Evidence-Grounded Generation

基于噪声声明验证的覆盖控制偏好挖掘用于基于证据的生成

Weixin Liu, Congning Ni, Qingyuan Song, Susannah L. Rose, Murat Kantarcioglu, Bradley A. Malin, Zhijun Yin

机构 * Vanderbilt University(范德比大学) Vanderbilt University Medical Center(范德比大学医学中心) Lirio Virginia Tech(弗吉尼亚理工大学)

专题命中 偏好对齐 :DPO(summary_cn,abstract);分类 cs.CL、cs.LG

AI总结 研究临床简要医院病程总结中基于证据生成的问题,引入VERI-DPO框架,将噪声声明验证转化为覆盖控制的摘要级偏好,经实验验证该框架能降低不支持率,提升模型表现。

Comments 15 pages, 1 figure, 8 tables. Major revision with locked MIMIC-IV transfer evaluation, blinded pairwise human assessment, matched multi-seed ablations, revised title, and revised author list

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.25524 2026-06-26 cs.AI cs.CL 新提交 82%

Cliff Tokens: Identifying Single-Token Failure Triggers in LLM Mathematical Reasoning

Cliff Tokens: 识别大语言模型数学推理中的单Token失败触发点

Jaeyong Ko, Pilsung Kang, Yukyung Lee

机构 * Seoul National University(首尔大学) Boston University(波士顿大学)

专题命中 偏好对齐 :DPO(summary_cn,abstract);分类 cs.CL、cs.AI

AI总结 提出“悬崖token”概念,通过自适应阈值和单侧双比例z检验识别导致推理失败的单个token,删除并重采样可恢复pass@64至1.0,并基于贪心选择和token熵建立分类法,通过Cliff-DPO优化提升准确率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.12365 2026-06-16 cs.IR cs.AI cs.CL 82%

TaoSR1: The Thinking Model for E-commerce Relevance Search

TaoSR1:电商相关性搜索的思考模型

Chenhe Dong, Shaowei Yao, Pengkun Jiao, Jianhui Yang, Yiming Jin, Zerui Huang, Xiaojiang Zhou, Dan Ou, Haihong Tang, Bo Zheng

机构 * Taobao & Tmall Group of Alibaba(淘宝与天猫集团)

专题命中 偏好对齐 :DPO(summary_cn,abstract);分类 cs.CL、cs.AI

AI总结 本文提出TaoSR1框架,通过CoT引导的监督微调、离线采样与DPO优化,解决电商搜索中相关性预测的推理误差与幻觉问题,实现高效部署。

Journal ref KDD '26: Proceedings of the 32nd ACM SIGKDD Conference on Knowledge Discovery and Data Mining V.2, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.12881 2026-06-15 cs.CL cs.LG 新提交 82%

Direct Preference Optimization for Chatbot Fine-Tuning: An Empirical Study

面向聊天机器人微调的直接偏好优化:一项实证研究

Dezhi Yu, Yvonne Qiu, ShuoJia Fu

机构 * University of Science and Technology of China(中国科学技术大学)

专题命中 偏好对齐 :DPO(summary_cn,abstract);分类 cs.CL、cs.LG

AI总结 本文实证研究直接偏好优化(DPO)在聊天机器人微调中的应用,表明其简化训练流程、提升计算效率且性能有竞争力,但存在训练不稳定性。

Comments 7 pages, 3 figures, 1 table. All authors contributed equally

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.12288 2026-06-11 cs.CL cs.AI 版本更新 82%

TokenRatio: Principled Token-Level Preference Optimization via Ratio Matching

TokenRatio: 通过比率匹配实现原理化的token级偏好优化

Truong Nguyen, Tien-Phat Nguyen, Linh Ngo Van, Duy Minh Ho Nguyen, Khoa Doan, Trung Le

机构 * National University of Singapore(新加坡国立大学) Institute of Cybernetics and Robotics, Czech Technical University in Prague(捷克布拉格技术大学控制论与机器人研究所)

专题命中 偏好对齐 :DPO(abstract,abstract_cn);alignment(abstract);harmlessness(abstract);分类 cs.CL、cs.AI

AI总结 本文提出TBPO方法,通过比率匹配恢复token级偏好最优性,改进对齐质量和训练稳定性,并增加输出多样性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.11134 2026-06-01 cs.LG cs.AI 82%

Spurious Correlation Learning in Preference Optimization: Mechanisms, Consequences, and Mitigation via Tie Training

偏好优化中的虚假相关学习:机制、后果及通过平局训练的缓解方法

Christian Moya, Alex Semendinger, Guang Lin, Elliott Thornley

机构 * Department of Mathematics, Purdue University, West Lafayette IN, USA(普渡大学数学系) School of Mechanical Engineering, Purdue University, West Lafayette IN, USA(普渡大学机械工程学院) Massachusetts Institute of Technology, Cambridge MA, USA(麻省理工学院)

专题命中 偏好对齐 :DPO(summary_cn,abstract);分类 cs.AI、cs.LG

AI总结 本文通过统一理论分析揭示了偏好优化(如DPO)中虚假相关学习的机制(均值虚假偏差和因果-虚假相关泄漏),证明其导致分布偏移下的不可逆脆弱性,并提出平局训练数据增强策略以选择性减少虚假学习。

Comments Proceedings of the 43rd International Conference on Machine Learning, 2026, Seoul, South Korea

Journal ref Proceedings of the 43rd International Conference on Machine Learning, 2026, Seoul, South Korea

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.21266 2026-05-21 cs.LG cs.AI 82%

How Much Online RL is Enough? Informative Rollouts for Offline Preference Optimization in RLVR

在线强化学习需要多少?用于RLVR中离线偏好优化的信息性回放

Richa Verma, Balaraman Ravindran

机构 * TCS Research Department of CSE(TCS计算机科学系研究部) IIT Madras(印度理工学院马德拉斯分校) Department of Data Science & AI(数据科学与人工智能系) Wadhwani School of Data Science & AI(Wadhwani数据科学与人工智能学院)

专题命中 偏好对齐 :DPO(summary_cn,abstract);分类 cs.AI、cs.LG

AI总结 本文提出G2D方法,通过短时GRPO预热、构建静态偏好数据集和离线DPO微调,以较低的计算成本实现优于GRPO的性能,强调偏好数据信息性而非数量的重要性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.23461 2026-05-20 cs.LG cs.AI 82%

Eliminating Inductive Bias in Reward Models with Information-Theoretic Guidance

通过信息论指导消除奖励模型中的归纳偏置

Zhuo Li, Pengyu Cheng, Zhechao Yu, Feifei Tong, Anningzhe Gao, Tsung-Hui Chang, Xiang Wan, Erchao Zhao, Xiaoxi Jiang, Guanjun Jiang

机构 * Qwen Large Model Application Team, Alibaba(阿里巴巴大模型应用团队) The Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳)) Shenzhen Research Institute of Big Data(深圳大数据研究院)

专题命中 偏好对齐 :RLHF(summary_cn,abstract);分类 cs.AI、cs.LG

AI总结 本文提出了一种基于信息论的奖励模型去偏方法DIR,通过最大化奖励模型评分与人类偏好对之间的互信息,同时最小化奖励模型输出与偏好输入偏置属性之间的互信息,从而有效缓解归纳偏置问题并提升RLHF性能。

Comments Published as a conference paper at The International Conference on Learning Representations (ICLR) 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.21357 2026-05-12 cs.AI cs.CL 82%

AgentHER: Hindsight Experience Replay for LLM Agent Trajectory Relabeling

AgentHER: 用于LLM代理轨迹重标记的回溯经验回放

Liang Ding

机构 * The University of Sydney(悉尼大学)

专题命中 偏好对齐 :DPO(summary_cn,abstract);分类 cs.CL、cs.AI

AI总结 AgentHER通过四阶段流程将废弃轨迹转化为SFT、DPO和ShareGPT训练数据,在WebArena和ToolBench上提升性能并提高样本效率,同时降低标签噪声。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.00931 2026-04-24 cs.LG cs.AI 82%

Continuous-Utility Direct Preference Optimization

连续效用直接偏好优化

Muhammad Ahmed Mohsin, Muhammad Umer, Ahsan Bilal, Zihao He, Muhammad Usman Rafique, Asad Aali, Muhammad Ali Jamshed, John M. Cioffi, Emily Fox

机构 * stanford(斯坦福大学) meta glasgow(格拉斯哥大学)

专题命中 偏好对齐 :DPO(summary_cn,abstract);分类 cs.AI、cs.LG

AI总结 本文提出CU-DPO框架,通过连续评分替代二元标签,提升模型在数学推理任务中的策略选择准确率和推理能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.17769 2026-04-21 cs.CL cs.AI 82%

Reverse Constitutional AI: A Framework for Controllable Toxic Data Generation via Probability-Clamped RLAIF

反宪法AI:通过概率限制RLAIF实现可控有毒数据生成的框架

Yuan Fang, Yiming Luo, Aimin Zhou, Fei Tan

机构 * East China Normal University(东华大学) Shanghai Innovation Institute(上海创新研究院)

专题命中 偏好对齐 :jailbreak(abstract,abstract_cn);safety(abstract);red teaming(abstract);分类 cs.CL、cs.AI

AI总结 本文提出反宪法AI框架,通过概率限制RLAIF生成可控的高质有毒数据,提升安全评估。

Comments Accepted to Findings of ACL 2026. 10 pages, 6 figures. Code and data available at https://github.com/ZeroLoss-Lab/R-CAI

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.14053 2026-04-17 cs.LG cs.AI cs.CV cs.MA eess.IV 82%

LLMOrbit: A Circular Taxonomy of Large Language Models -From Scaling Walls to Agentic AI Systems

LLMOrbit:大型语言模型的圆形分类法——从扩展壁垒到智能体AI系统

Badri N. Patro, Vijay S. Agneeswaran

机构 * Microsoft(微软)

专题命中 偏好对齐 :RLHF(abstract,abstract_cn);DPO(abstract,abstract_cn);分类 cs.AI、cs.LG

AI总结 本文提出LLMOrbit,通过八个维度分析2019-2025年50余种大型语言模型,揭示数据稀缺、成本激增和能源消耗三大危机,并提出六种突破扩展壁垒的范式,推动生成AI和智能体系统的发展。

详情

展开后加载摘要…

URL PDF HTML 收藏