Training Language Models with Language Feedback
专题命中 后训练与偏好优化 :language model(title,abstract);large language model(abstract);分类 cs.CL、cs.AI、cs.LG
Comments The First Workshop on Learning with Natural Language Supervision at ACL 2022
AI 大模型
大语言模型、预训练、指令微调、后训练和语言模型应用。
专题命中 后训练与偏好优化 :language model(title,abstract);large language model(abstract);分类 cs.CL、cs.AI、cs.LG
Comments The First Workshop on Learning with Natural Language Supervision at ACL 2022
Polaris:基于检索反馈学习生成表格描述
机构 * University of Wisconsin-Madison(威斯康星大学麦迪逊分校)
专题命中 后训练与偏好优化 :LLM(summary_cn,abstract);preference optimization(abstract);分类 cs.CL
AI总结 Polaris是基于检索反馈训练LLM生成表格描述的系统,通过BM25排序和DPO微调优化检索效果,性能优于AutoDDG,证明检索基准可用于训练LLM生成面向检索的元数据。
Comments 22 pages, 6 figures
为何摘要变得中立:人类反馈强化学习中情感漂移的策略归因
机构 * Instituto Politécnico Nacional (IPN)(墨西哥国立理工学院) ; Centro de Investigación en Computación (CIC)(计算机研究中心)
专题命中 后训练与偏好优化 :RLHF(summary_cn,abstract);LLM(abstract_cn);分类 cs.CL
AI总结 本文针对RLHF引发摘要情感漂移的问题,提出Policy Attribution框架溯源漂移来源,验证了跨语言漂移特性,并提出感知情感的正则化技术以降低漂移,且相关代码将公开。
CEDAR-GRPO:面向大语言模型通用溯因推理的过程感知强化学习
机构 * Sharif University of Technology(谢里夫理工大学) ; University of Tehran(德黑兰大学)
专题命中 后训练与偏好优化 :LLM(summary_cn,abstract);post-training(abstract);分类 cs.AI
AI总结 本文提出过程感知强化学习框架CEDAR-GRPO,通过后训练提升LLM的通用溯因推理能力,在11个未见任务上实现显著性能提升,验证了其迁移有效性。
Comments Code and data are available at https://github.com/cedar-grpo/cedar-grpo
BridgeAlign:面向人文社科的偏好对齐框架
机构 * Alibaba Group(阿里巴巴集团) ; Ant Group(蚂蚁集团)
专题命中 后训练与偏好优化 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);preference optimization(abstract)
AI总结 该研究针对人文社科领域的偏好对齐需求,提出BridgeAlign框架,经21万+合成偏好样本对齐后,使Qwen3-8B在17个基准测试中优于11个强基线,且人工偏好与知识能力无权衡。
JustLLMGRPO:面向胸部X射线生成的放射学控制
专题命中 后训练与偏好优化 :LLM(summary_cn,abstract);prompting(abstract);分类 cs.AI
AI总结 JustLLMGRPO仅对LLM提示词策略应用GRPO,在冻结Sana生成器的前提下,提升了胸部X射线生成的质量,同时维持了提示词对齐度,实现了最优性能。
训练多模态大语言模型(MLLMs)说“不”:基于拒绝校准GRPO的广义指代表达理解
专题命中 后训练与偏好优化 :SFT(abstract,abstract_cn);large language model(abstract);language model(abstract);post-training(abstract)
AI总结 针对MLLMs因训练缺负样本导致无法拒绝不存在对象的问题,提出RC-GRPO方法,在保持定位精度的同时增强拒绝能力,在三个GREC基准上表现优异。
在弱到强对齐中评估风险:从偏差-方差视角出发
机构 * University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) ; Microsoft(微软) ; InstaDeep ; New York University(纽约大学)
专题命中 后训练与偏好优化 :SFT(abstract,abstract_cn);RLHF(abstract,abstract_cn);post-training(abstract);分类 cs.AI
AI总结 本文从偏差-方差视角分析弱到强对齐的风险,通过连续置信度分数研究经验组件,发现强模型方差是欺骗的主要预测因素,表明弱强依赖性的重要性。
替代更新何时能改进决策?轨迹式迁移的局部理论
机构 * The Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳))
专题命中 后训练与偏好优化 :LLM(summary_cn,abstract);post-training(abstract);分类 cs.LG
AI总结 该研究提出轨迹式迁移的局部理论,探究替代更新改进决策的条件,推导相关梯度、校准等理论结果,通过网格世界和LLM后训练实验验证结论。
Comments 22 pages in total, including references and appendices; 3 composite figures (9 panels) and 4 tables. Code is available at https://github.com/Ethan-Shen-Individual-Lab/surrogate-to-decision-transfer
基于人类反馈的强化学习
机构 * Nathan Lambert(纳瑟恩·拉姆伯特)
专题命中 后训练与偏好优化 :RLHF(abstract,abstract_cn);language model(abstract);instruction tuning(abstract);post-training(abstract)
AI总结 本书系统介绍强化学习从人类反馈的核心方法,涵盖指令微调、奖励模型训练及拒绝采样等关键技术,探讨合成数据与评估中的前沿问题。
Comments 239 pages. Web-native version at https://rlhfbook.com/ Continually improving, latest version at website
Agentic-DPO:从专家轨迹上的模仿到智能体策略优化
机构 * Johns Hopkins University(约翰·霍普金斯大学)
专题命中 后训练与偏好优化 :SFT(abstract,abstract_cn);LLM(abstract);large language model(abstract);language model(abstract)
AI总结 研究针对大语言模型智能体基于专家轨迹训练只学动作序列、难应对错误的问题,提出Agentic-DPO方法,通过转化专家轨迹为状态条件偏好监督,结合策略保持增强,实现低成本智能体策略优化,实验验证其有效性。
真实还是编造?利用因果归因减轻解释中的奖励作弊
机构 * Institute for Logic, Language and Computation (ILLC), University of Amsterdam(逻辑、语言与计算研究所(ILLC),阿姆斯特丹大学) ; Institute for Language, Cognition and Computation (ILCC), University of Edinburgh(语言、认知与计算研究所(ILCC),爱丁堡大学)
专题命中 后训练与偏好优化 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);preference optimization(abstract)
AI总结 研究大语言模型解释中因奖励模型导致的奖励作弊问题,提出用预测的因果归因丰富奖励模型输入的方法,该方法能减少大语言模型生成误导性解释的倾向,提升解释忠实度。
Comments ICLR 2026 Camera-ready
超越有监督澄清:基于LLM的输入重写用于对话篇章解析
专题命中 后训练与偏好优化 :LLM(title_cn,summary_cn);prompting(abstract);分类 cs.CL
AI总结 研究在无监督条件下利用LLM零样本或基于解析器反馈重写输入以提升对话篇章解析性能,发现重写常引入回归,提出选择性干预问题并识别可重写性预测为关键缺失能力。
Comments Accepted to SIGDIAL 2026. 17 pages, 2 figures
事后合并是不够的:基于损失差距平衡的多轮模型合并
机构 * Soongsil University, Republic of Korea(韩国顺斯大学) ; Department of Electrical and Computer Engineering, Sungkyunkwan University, Republic of Korea(成均馆大学电子与计算机工程系)
专题命中 后训练与偏好优化 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);post-training(abstract)
AI总结 提出METIS方法,通过迭代多轮合并和任务损失差距加权,解决多任务模型合并中的信息擦除问题,显著提升最差任务性能。
Comments Accepted to the 43rd International Conference on Machine Learning (ICML 2026)
全双工语音模型中的多面交互对齐
机构 * Kyutai ; Gradium
专题命中 后训练与偏好优化 :LLM(summary_cn,abstract);post-training(abstract);分类 cs.CL
AI总结 针对全双工对话模型交互性问题,提出基于强化学习的后训练对齐方法,从暂停处理、话轮转换、回馈和用户打断四个维度优化,并加入LLM奖励防止语义退化,在Moshi和PersonaPlex上取得一致改进。
LCAM:诊断对话式AI中交互对齐失败的框架
机构 * School of Management and Economics, The Chinese University of Hong Kong, Shenzhen(香港中文大学深圳校区管理学院)
专题命中 后训练与偏好优化 :LLM(summary_cn,abstract);preference optimization(abstract);分类 cs.AI
AI总结 提出分层认知对齐模型(LCAM),通过五层对齐和两种失调极性诊断对话式AI的交互失败,应用于LLM咨询案例揭示潜在危害。
奖励学习中的表示-可理性权衡
机构 * Vector Institute(向量研究所) ; University of Waterloo(滑铁库大学)
专题命中 后训练与偏好优化 :RLHF(summary_cn,abstract);preference optimization(abstract);分类 cs.LG
AI总结 本文研究RLHF中奖励学习面临的表示与可理性之间的权衡,通过分解交叉熵损失为表示项和聚合项,证明更丰富的表示会扩大不可理性比较的数量,且联合训练无法自动达到最优平衡点。
奖励偏差替代:单轴偏差缓解措施重定向优化压力
机构 * Stanford University(斯坦福大学) ; University of Pennsylvania(宾夕法尼亚大学)
专题命中 后训练与偏好优化 :LLM(abstract,abstract_cn);RLHF(abstract,abstract_cn);language model(abstract);分类 cs.AI
AI总结 本文提出奖励偏差替代现象,即单轴缓解奖励模型偏差(如减少对长度、谄媚或风格的依赖)会将优化压力转移到相关代理上而非消除,并通过理论证明和实验(如GRPO训练中的长度惩罚导致过度自信)揭示了该问题,建议在评估中纳入策略诱导分布并跟踪多偏差。
Comments Improved readability (mostly appendix D)
单GPU上的对齐与偏好学习的凸优化
机构 * Department of Electrical Engineering, Stanford University, California, United States(斯坦福大学电气工程系,加州,美国)
专题命中 后训练与偏好优化 :RLHF(abstract,abstract_cn);large language model(abstract);language model(abstract);preference optimization(abstract)
AI总结 提出COALA算法,利用凸优化重表述消除参考模型,在单GPU上高效训练,性能与DPO相当但计算量仅为其17.6%。
AMATA: 适应性多智能体轨迹对齐用于知识密集型问答
机构 * School of Computer Science and Information Engineering, Hefei University of Technology(合肥工业大学计算机科学与信息工程学院) ; Shanghai University of Electric Power(上海电力大学) ; East China Normal University(华东师范大学) ; Guangdong University of Finance and Economics(广东财经大学) ; Alibaba Group(阿里巴巴集团)
专题命中 后训练与偏好优化 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);preference optimization(abstract)
AI总结 本研究提出AMATA框架,通过动态整合外部知识提高知识密集型问答的响应可解释性和事实准确性,采用六个专门化智能体协作执行复杂问题推理,并引入两种创新:轨迹内偏好学习和智能体间依赖学习。
在关键领域学习:用于鲁棒偏好对齐的几何锚定
机构 * PYLER ; KAIST(韩国科学技术院)
专题命中 后训练与偏好优化 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);preference optimization(abstract)
AI总结 GAPO通过动态几何锚定机制改进偏好对齐,通过局部敏感度自适应调整偏好对重要性,减少噪声影响,提升模型鲁棒性。
Comments Under Review
重要采样误分配信用:用于结果监督强化学习的非对称比率
机构 * The Hong Kong University of Science and Technology(香港科技大学) ; Kuaishou Technology(快手科技) ; Tsinghua University(清华大学)
专题命中 后训练与偏好优化 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);post-training(abstract)
AI总结 本文揭示了在结果监督强化学习中,重要采样比率因角色转变导致正优势token与负优势token的权重失衡,提出非对称重要采样策略ASPO以纠正此问题,提升训练稳定性与性能。
语义奖励崩溃与自适应AI系统中知识完整性保护
机构 * BDB Labs / BagelTech(BDB实验室/BagelTech)
专题命中 后训练与偏好优化 :RLHF(abstract,abstract_cn);large language model(abstract);language model(abstract);preference optimization(abstract)
AI总结 研究探讨了自适应AI系统中语义奖励崩溃问题,指出其导致知识完整性受损,并提出宪法奖励分层框架以保护不同知识属性。
Comments 15 pages including references. Position and framework paper. Companion empirical work available at arXiv:2604.17587
忘掉BIT,一切关于TOKEN:面向大语言模型的语义信息理论
机构 * Bo Bai(白波)
专题命中 后训练与偏好优化 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);post-training(abstract)
AI总结 本文提出语义信息理论,将TOKEN作为意义载体,重构注意力机制和Transformer模型,建立预训练、强化学习和推理中的信息度量方法,明确下一token预测与格兰杰因果推断的关系。
基于PPO的代理流水线:自适应提示选择与测试用例生成
机构 * Department of Computer Science and Engineering, SRM University AP, India(印度SRM大学计算机科学与工程系)
专题命中 后训练与偏好优化 :LLM(summary_cn,abstract);prompting(abstract);分类 cs.LG
AI总结 本文提出一种基于强化学习的代理框架,利用PPO与LLM生成测试用例,通过自适应提示选择提升代码覆盖率。实验表明PPO-LLM在分支和行覆盖率上优于现有方法。
是什么让大语言模型(LLMs)成为有效的序列推荐者?对偏好强度和时间上下文的研究
机构 * Department of Computer Science, Dartmouth College(达特茅斯大学计算机科学系) ; ByteDance, US(字节跳动(美国)) ; Department of Computer Science and Engineering, University of Notre Dame(诺丁汉大学计算机科学与工程系)
专题命中 后训练与偏好优化 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);preference optimization(abstract)
AI总结 本文研究了LLMs在序列推荐中有效性的关键因素,提出RecPO框架通过整合显式和隐式反馈,提升推荐性能,强调偏好强度和时间上下文的重要性。
Comments Accepted The 64th Annual Meeting of the Association for Computational Linguistics (ACL 2026)
向小偷致敬:探索去中心化GRPO中的攻击与防御
机构 * Gensyn ; Université de Neuchâtel(Neuchâtel大学)
专题命中 后训练与偏好优化 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);post-training(abstract)
AI总结 本文研究去中心化GRPO的鲁棒性,提出首个对抗攻击及防御措施,通过恶意节点污染良性模型,展示攻击成功率可达100%,并提出两种防御机制以减轻攻击影响。
Comments Accepted to ACL Findings 2026
基于人类反馈的强化学习:统计学视角
机构 * Department of Biostatistics, Yale University(耶鲁大学生物统计学系) ; Department of Statistics, London School of Economics and Political Science(伦敦政治经济学院统计学系) ; Mitch Daniels School of Business, Purdue University(普渡大学米奇·丹尼尔斯商学院)
专题命中 后训练与偏好优化 :LLM(abstract);large language model(abstract);language model(abstract);RLHF(abstract)
AI总结 本文从统计学角度探讨了基于人类反馈的强化学习,分析了其在大语言模型对齐中的核心方法与挑战,包括奖励模型学习和策略优化,并讨论了相关统计模型和最新研究进展。
HPS: 人类偏好对齐的硬偏好采样
机构 * Singapore Management University(新加坡国立管理学院) ; The Hong Kong Polytechnic University(香港理工大学)
专题命中 后训练与偏好优化 :LLM(abstract);large language model(abstract);language model(abstract);RLHF(abstract)
AI总结 本文提出HPS框架,通过优先选择最受好评的响应并拒绝所有不受欢迎和有害的响应,提升大语言模型与人类偏好的对齐效率和鲁棒性。
在策略镜像下降中近似对数分区函数诱导隐式正则化以提升LLM训练
机构 * Georgia Institute of Technology(佐治亚理工学院) ; Amazon(亚马逊)
专题命中 后训练与偏好优化 :LLM(title);post-training(title);分类 cs.LG
AI总结 PMD-mean通过近似对数分区函数实现隐式正则化,提升LLM训练的稳定性和效率。