ChatGLM-RLHF: Practices of Aligning Large Language Models with Human Feedback
专题命中 偏好对齐 :RLHF(title,abstract);alignment(abstract);分类 cs.CL
AI 大模型
大模型对齐、安全、越狱、红队、提示注入和可信评测。
专题命中 偏好对齐 :RLHF(title,abstract);alignment(abstract);分类 cs.CL
专题命中 偏好对齐 :alignment(title,abstract);RLHF(abstract);分类 cs.AI
专题命中 偏好对齐 :alignment(title);RLHF(abstract);safety(abstract);分类 cs.LG
Comments 11 pages, 5 figures
专题命中 偏好对齐 :alignment(title,abstract);safety(abstract);分类 cs.AI
Comments arXiv admin note: text overlap with arXiv:2110.09240 by other authors
Journal ref NeurIPS 2023 MP2 Workshop
专题命中 偏好对齐 :alignment(title,abstract);RLHF(abstract);分类 cs.CL
Comments Published at NeurIPS 2023
专题命中 偏好对齐 :alignment(title,abstract);RLHF(abstract);分类 cs.CL
Comments Preprint
专题命中 偏好对齐 :RLHF(title,abstract);alignment(abstract);分类 cs.CL
Comments Preprint
专题命中 偏好对齐 :DPO(title,abstract);分类 cs.CL、cs.AI、cs.LG
Comments Code, data, and models are available at https://github.com/dvlab-research/Step-DPO
专题命中 偏好对齐 :alignment(title,abstract);分类 cs.CL、cs.AI、cs.LG
Comments Accepted at ICML 2024 Workshop on Models of Human Feedback for AI Alignment, Vienna, Austria
专题命中 偏好对齐 :alignment(title,comments);RLHF(abstract);分类 cs.CL、cs.AI、cs.LG
Comments Previous Title: SALMON: Self-Alignment with Principle-Following Reward Models. Accepted to ICLR 2024. Project page: https://github.com/IBM/SALMON
ChainPrune:评估与减少长思维链推理中的冗余
机构 * Alibaba Group(阿里巴巴集团)
专题命中 偏好对齐 :DPO(summary_cn,abstract);分类 cs.AI、cs.LG
AI总结 ChainPrune 是一种推理路径语义结构优化方法,通过整合推理路径为树结构、选择主导路径及结合 DPO 与监督损失,减少长思维链冗余,在保精度的同时降低了步骤长度与计算开销。
Comments 15 pages, 12 figures, 4 tables
奖励引导自回归图生成的高效多智能体通信拓扑设计
专题命中 偏好对齐 :RLHF(summary_cn,abstract);分类 cs.CL、cs.LG
AI总结 针对多智能体系统通信拓扑设计中 token 消耗过高的问题,本文提出 RGA-Designer 方法,通过结合 RLHF 训练奖励模型微调图生成器,在保持任务准确率的同时降低了 token 消耗。
Comments Full version of extended abstract accepted at ICONIP 2026 (poster)
如何使用你的专家预算:蛋白质结构预测模型的实用指南
机构 * InstaDeep Ltd(InstaDeep公司) ; University of Oxford(牛津大学) ; Lancaster University(兰卡斯特大学)
专题命中 偏好对齐 :DPO(summary_cn,abstract);分类 cs.AI、cs.LG
AI总结 本研究针对蛋白质结构预测模型的专家预算约束,通过基准测试FK-steering、DPO、Best K-of-N采样及O3方法,明确不同预算下的最优方法并给出实用选择建议。
Comments Proceedings of the ICML 2026 Workshop on Structured Probabilistic Inference & Generative Modeling (SPIGM)
偏好树优化:通过前瞻模拟增强面向目标的对话
机构 * Reichman University(赖希曼大学) ; School of Computer Science(计算机科学学院) ; School of Communications(传播学院)
专题命中 偏好对齐 :DPO(summary_cn,abstract);分类 cs.CL、cs.AI
AI总结 本研究提出偏好树优化(PTO)框架,结合带前瞻的偏好树与直接偏好优化(DPO),在动机访谈领域通过虚拟患者等模拟对话生成偏好数据,训练的对话智能体在关键指标上优于基线。
Comments 13 pages, 4 figures. Accepted at an ICLR 2025 workshop
强化步骤级推理以实现大语言模型的有效自校正
机构 * Nanyang Technological University(南洋理工大学) ; National University of Singapore(新加坡国立大学) ; VinUniversity ; Institute for Infocomm Research (IR), A*STAR(新加坡科技研究局信息通信研究院)
专题命中 偏好对齐 :DPO(summary_cn,abstract);分类 cs.CL、cs.AI
AI总结 针对大语言模型自校正的核心挑战,提出SFS-DPO及教师辅助变体SFS-DPO-R框架,经多模型多域评估,其性能优于现有步骤级训练基线,可提升自校正频率与有效性。
SP3O:无需奖励建模的分段偏好强化学习
机构 * University of Michigan(密歇根大学)
专题命中 偏好对齐 :RLHF(abstract,abstract_cn);DPO(abstract,abstract_cn);分类 cs.AI、cs.LG
AI总结 SP3O是一种无需奖励建模的新型PbRL算法,利用分段级偏好反馈,通过PPO型损失函数优化策略,在机器人控制和LLM微调等长视界任务中性能优于现有算法。
自分割轨迹:智能体声明边界作为训练单元
专题命中 偏好对齐 :DPO(summary_cn,abstract);分类 cs.AI、cs.LG
AI总结 该研究提出智能体声明边界的采集时语义自分割方法,将其作为训练单元,实验表明该分段具有一致性,下游DPO在特定任务中表现优于对照组。
Comments 20 pages, 6 figures, 11 tables. Includes appendices with full controls and ablations
Groc-PO:用于真实多模态大语言模型的基于上下文的偏好优化
机构 * University of Science and Technology of China(中国科学技术大学) ; Xiaomi Corporation(小米公司) ; State Key Laboratory of Communication Content Cognition, People’s Daily Online(人民日报社传播内容认知国家重点实验室)
专题命中 偏好对齐 :DPO(abstract,abstract_cn);alignment(abstract);trustworthy(abstract);分类 cs.CL、cs.AI
AI总结 研究针对多模态大语言模型的不真实问题,提出基于上下文的偏好优化框架Groc-PO,构建相关数据集,通过多阶段偏好样本捕捉基础上下文,加强上下文相关推理,减轻跨阶段错误传播,提升模型性能。
Comments Accepted by ACM-MM 2026
基于噪声声明验证的覆盖控制偏好挖掘用于基于证据的生成
机构 * Vanderbilt University(范德比大学) ; Vanderbilt University Medical Center(范德比大学医学中心) ; Lirio ; Virginia Tech(弗吉尼亚理工大学)
专题命中 偏好对齐 :DPO(summary_cn,abstract);分类 cs.CL、cs.LG
AI总结 研究临床简要医院病程总结中基于证据生成的问题,引入VERI-DPO框架,将噪声声明验证转化为覆盖控制的摘要级偏好,经实验验证该框架能降低不支持率,提升模型表现。
Comments 15 pages, 1 figure, 8 tables. Major revision with locked MIMIC-IV transfer evaluation, blinded pairwise human assessment, matched multi-seed ablations, revised title, and revised author list
Cliff Tokens: 识别大语言模型数学推理中的单Token失败触发点
机构 * Seoul National University(首尔大学) ; Boston University(波士顿大学)
专题命中 偏好对齐 :DPO(summary_cn,abstract);分类 cs.CL、cs.AI
AI总结 提出“悬崖token”概念,通过自适应阈值和单侧双比例z检验识别导致推理失败的单个token,删除并重采样可恢复pass@64至1.0,并基于贪心选择和token熵建立分类法,通过Cliff-DPO优化提升准确率。
TaoSR1:电商相关性搜索的思考模型
机构 * Taobao & Tmall Group of Alibaba(淘宝与天猫集团)
专题命中 偏好对齐 :DPO(summary_cn,abstract);分类 cs.CL、cs.AI
AI总结 本文提出TaoSR1框架,通过CoT引导的监督微调、离线采样与DPO优化,解决电商搜索中相关性预测的推理误差与幻觉问题,实现高效部署。
Journal ref KDD '26: Proceedings of the 32nd ACM SIGKDD Conference on Knowledge Discovery and Data Mining V.2, 2026
面向聊天机器人微调的直接偏好优化:一项实证研究
机构 * University of Science and Technology of China(中国科学技术大学)
专题命中 偏好对齐 :DPO(summary_cn,abstract);分类 cs.CL、cs.LG
AI总结 本文实证研究直接偏好优化(DPO)在聊天机器人微调中的应用,表明其简化训练流程、提升计算效率且性能有竞争力,但存在训练不稳定性。
Comments 7 pages, 3 figures, 1 table. All authors contributed equally
TokenRatio: 通过比率匹配实现原理化的token级偏好优化
机构 * National University of Singapore(新加坡国立大学) ; Institute of Cybernetics and Robotics, Czech Technical University in Prague(捷克布拉格技术大学控制论与机器人研究所)
专题命中 偏好对齐 :DPO(abstract,abstract_cn);alignment(abstract);harmlessness(abstract);分类 cs.CL、cs.AI
AI总结 本文提出TBPO方法,通过比率匹配恢复token级偏好最优性,改进对齐质量和训练稳定性,并增加输出多样性。
偏好优化中的虚假相关学习:机制、后果及通过平局训练的缓解方法
机构 * Department of Mathematics, Purdue University, West Lafayette IN, USA(普渡大学数学系) ; School of Mechanical Engineering, Purdue University, West Lafayette IN, USA(普渡大学机械工程学院) ; Massachusetts Institute of Technology, Cambridge MA, USA(麻省理工学院)
专题命中 偏好对齐 :DPO(summary_cn,abstract);分类 cs.AI、cs.LG
AI总结 本文通过统一理论分析揭示了偏好优化(如DPO)中虚假相关学习的机制(均值虚假偏差和因果-虚假相关泄漏),证明其导致分布偏移下的不可逆脆弱性,并提出平局训练数据增强策略以选择性减少虚假学习。
Comments Proceedings of the 43rd International Conference on Machine Learning, 2026, Seoul, South Korea
Journal ref Proceedings of the 43rd International Conference on Machine Learning, 2026, Seoul, South Korea
在线强化学习需要多少?用于RLVR中离线偏好优化的信息性回放
机构 * TCS Research Department of CSE(TCS计算机科学系研究部) ; IIT Madras(印度理工学院马德拉斯分校) ; Department of Data Science & AI(数据科学与人工智能系) ; Wadhwani School of Data Science & AI(Wadhwani数据科学与人工智能学院)
专题命中 偏好对齐 :DPO(summary_cn,abstract);分类 cs.AI、cs.LG
AI总结 本文提出G2D方法,通过短时GRPO预热、构建静态偏好数据集和离线DPO微调,以较低的计算成本实现优于GRPO的性能,强调偏好数据信息性而非数量的重要性。
通过信息论指导消除奖励模型中的归纳偏置
机构 * Qwen Large Model Application Team, Alibaba(阿里巴巴大模型应用团队) ; The Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳)) ; Shenzhen Research Institute of Big Data(深圳大数据研究院)
专题命中 偏好对齐 :RLHF(summary_cn,abstract);分类 cs.AI、cs.LG
AI总结 本文提出了一种基于信息论的奖励模型去偏方法DIR,通过最大化奖励模型评分与人类偏好对之间的互信息,同时最小化奖励模型输出与偏好输入偏置属性之间的互信息,从而有效缓解归纳偏置问题并提升RLHF性能。
Comments Published as a conference paper at The International Conference on Learning Representations (ICLR) 2026
AgentHER: 用于LLM代理轨迹重标记的回溯经验回放
机构 * The University of Sydney(悉尼大学)
专题命中 偏好对齐 :DPO(summary_cn,abstract);分类 cs.CL、cs.AI
AI总结 AgentHER通过四阶段流程将废弃轨迹转化为SFT、DPO和ShareGPT训练数据,在WebArena和ToolBench上提升性能并提高样本效率,同时降低标签噪声。
连续效用直接偏好优化
机构 * stanford(斯坦福大学) ; meta ; glasgow(格拉斯哥大学)
专题命中 偏好对齐 :DPO(summary_cn,abstract);分类 cs.AI、cs.LG
AI总结 本文提出CU-DPO框架,通过连续评分替代二元标签,提升模型在数学推理任务中的策略选择准确率和推理能力。
反宪法AI:通过概率限制RLAIF实现可控有毒数据生成的框架
机构 * East China Normal University(东华大学) ; Shanghai Innovation Institute(上海创新研究院)
专题命中 偏好对齐 :jailbreak(abstract,abstract_cn);safety(abstract);red teaming(abstract);分类 cs.CL、cs.AI
AI总结 本文提出反宪法AI框架,通过概率限制RLAIF生成可控的高质有毒数据,提升安全评估。
Comments Accepted to Findings of ACL 2026. 10 pages, 6 figures. Code and data available at https://github.com/ZeroLoss-Lab/R-CAI
LLMOrbit:大型语言模型的圆形分类法——从扩展壁垒到智能体AI系统
机构 * Microsoft(微软)
专题命中 偏好对齐 :RLHF(abstract,abstract_cn);DPO(abstract,abstract_cn);分类 cs.AI、cs.LG
AI总结 本文提出LLMOrbit,通过八个维度分析2019-2025年50余种大型语言模型,揭示数据稀缺、成本激增和能源消耗三大危机,并提出六种突破扩展壁垒的范式,推动生成AI和智能体系统的发展。