SALSA: Soup-based Alignment Learning for Stronger Adaptation in RLHF
专题命中 后训练与偏好优化 :RLHF(title,abstract);LLM(abstract);large language model(abstract);language model(abstract)
AI 大模型
大语言模型、预训练、指令微调、后训练和语言模型应用。
专题命中 后训练与偏好优化 :RLHF(title,abstract);LLM(abstract);large language model(abstract);language model(abstract)
面向时间序列基础模型强化学习后训练的真实值邻域正则化方法
专题命中 后训练与偏好优化 :foundation model(title,abstract);post-training(title,abstract);分类 cs.AI、cs.LG
AI总结 针对时间序列基础模型强化学习后训练的次优崩溃问题,提出真实值邻域正则化方法,可缓解该问题并提升模型性能,且能灵活集成到各类强化学习方法中。
TRACE:基于轨迹的安全补丁学习用于大语言模型训练后调整
机构 * LERo
专题命中 后训练与偏好优化 :LLM(title);post-training(title);large language model(abstract);language model(abstract)
AI总结 研究针对FTaaS平台削弱模型安全对齐的问题,提出TRACE框架,通过模拟有害轨迹生成损坏状态,优化插件补丁,在保持效用的同时恢复模型安全,在多基准测试和模型上占据安全 - 效用前沿。
基于表示的语言模型探索:从测试时到训练后
机构 * Princeton University(普林斯顿大学) ; Microsoft Research(微软研究院)
专题命中 后训练与偏好优化 :language model(title,abstract);post-training(title,abstract);分类 cs.AI、cs.LG
AI总结 研究语言模型中强化学习探索新行为的价值,提出基于预训练模型隐藏状态的表示奖励探索方法,在推理时和训练后都显著提升了模型性能,如验证效率和测试时样本效率,为发现新行为提供实用途径。
Comments Accepted at ICLR 2026. Website and code: https://rep-exp.github.io
利用文本拒绝方向实现多模态安全
机构 * University of Trento(特伦托大学)
专题命中 后训练与偏好优化 :LLM(summary_cn,abstract);large language model(abstract);language model(abstract);post-training(abstract)
AI总结 提出MARS方法,通过从LLM骨干提取的文本拒绝方向泛化到多模态,无需多模态安全数据即可提升安全性,在五个先进MLLM上验证了有效性。
Comments Preprint
面向规范学习:从偏好对进行推理时对齐
机构 * Carnegie Mellon University(卡内基梅隆大学)
专题命中 后训练与偏好优化 :LLM(summary_cn,abstract);large language model(abstract);language model(abstract);preference optimization(abstract)
AI总结 提出规范学习框架,利用少量用户指令和偏好判断生成自然语言规范,在推理时引导LLM行为,无需参数更新,在密集偏好信号领域优于DPO,且规范可解释。
LLM上的模块化强化学习:从MDP创建到探索与学习
机构 * VU Amsterdam(阿姆斯特丹自由大学) ; University of Maryland, Baltimore County(马里兰大学巴尔的摩县分校) ; Leiden University(莱顿大学) ; University of Warsaw(华沙大学) ; Simon Fraser University(西蒙菲莎大学) ; The University of Hong Kong(香港大学)
专题命中 后训练与偏好优化 :LLM(title_cn,summary_cn);post-training(abstract);分类 cs.AI、cs.LG
AI总结 本文系统梳理LLM后训练中的强化学习方法,从MDP构建、探索策略到学习范式,揭示当前方法分布不均,指出价值函数、离策略AC及自举法等领域存在研究空白。
复述、奖励、重复:面向叙事理论启发的故事复述的强化学习
机构 * University of New South Wales(新南威尔士大学)
专题命中 后训练与偏好优化 :LLM(summary_cn,abstract);SFT(abstract,abstract_cn);post-training(abstract);分类 cs.CL、cs.AI
AI总结 提出RRR强化学习框架,结合结构主义叙事学与标量叙事性,通过d-RLAIF从文本特征中获取训练信号,无需参考输出,提升LLM故事复述的逻辑性、合理性和完整性。
Comments 8 Pages, 7 figures
ConSteer-RL:通过置信度感知强化学习引导大型语言模型的推理能力
机构 * Xi'an Jiaotong University(西安交通大学) ; University of Science and Technology of China(中国科学技术大学)
专题命中 后训练与偏好优化 :large language model(title,abstract);language model(title,abstract);分类 cs.CL、cs.LG
AI总结 提出ConSteer-RL框架,将模型log概率的token级置信度信号融入GRPO,通过置信度感知奖励塑造机制惩罚过度自信错误并强化正确自信推理,在多个模型规模上平均提升2.3%-4.0%。
整合奖励扰动用于大语言模型后训练
机构 * Technical University of Munich(慕尼黑技术大学) ; Munich Center for Machine Learning (MCML)(慕尼黑机器学习中心(MCML))
专题命中 后训练与偏好优化 :post-training(title,abstract);LLM(title);language model(abstract);分类 cs.CL、cs.LG
AI总结 提出CoRP方法,通过奖励加权聚合、兼容性重加权和验证门控,将奖励扰动整合为单一模型,无需梯度,在单次推理下平均提升8.1分。
后训练语言模型以实现跨语言一致性
机构 * ETH Zürich(苏黎世联邦理工学院) ; CLCG, University of Groningen(格罗宁根大学CLCG中心) ; University of Amsterdam(阿姆斯特丹大学)
专题命中 后训练与偏好优化 :language model(title,abstract);post-training(title,abstract);分类 cs.CL、cs.AI
AI总结 针对多语言模型对翻译等价提示响应不一致的问题,提出基于信息论的跨语言一致性定义,并开发后训练方法直接一致性优化(DCO)以提升一致性。
Comments ICML 2026. The first two authors contributed equally. Codes available at: https://github.com/Betswish/ConsistencyRL
RUBRIC-ARROW:面向不可验证领域的大语言模型后训练的交替逐点评分规则奖励建模
机构 * University at Albany(阿尔巴尼大学) ; Rutgers University(罗格斯大学) ; Purdue University(普渡大学) ; Independent Researcher(独立研究员) ; Emory University(埃默里大学) ; Georgia Institute of Technology(佐治亚理工学院)
专题命中 后训练与偏好优化 :LLM(title,abstract);post-training(title,abstract);分类 cs.CL、cs.LG
AI总结 针对非可验证领域绝对评分困难的问题,提出交替框架RUBRIC-ARROW,联合训练规则生成器和条件裁判,通过概率评分规则和交替GRPO减少平局,提升奖励建模准确率并改善下游策略后训练。
面向大语言模型的上下文不变安全对齐
机构 * Fudan University, Shanghai, China(复旦大学,上海,中国) ; Shanghai Artificial Intelligence Laboratory, Shanghai, China(上海人工智能实验室,上海,中国)
专题命中 后训练与偏好优化 :large language model(title);language model(title);post-training(abstract);preference optimization(abstract)
AI总结 本文提出了一种上下文不变的安全对齐方法,通过引入锚点不变正则化(AIR)来提升模型在不同上下文中的鲁棒性,从而增强安全约束对对抗性框架的抵抗力。
Comments ICML 2026
通过迭代奖励引导的后训练改进表格语言模型
机构 * Department of Engineering, University of Cambridge(剑桥大学工程系) ; CISPA Helmholtz Center for Information Security, Saarbrücken, Germany(德国萨尔布吕肯信息安全中心) ; The Alan Turing Institute, London(伦敦阿兰·图灵研究所)
专题命中 后训练与偏好优化 :language model(title,abstract);post-training(title,abstract);分类 cs.AI、cs.LG
AI总结 本文研究了通过生成-评分-对齐协议进行迭代奖励引导的后训练,提出了一种基于组相对对齐的方法TabGRAA,通过比较高分和低分生成组的组平均策略/参考对数比来改进表格语言模型,在五个混合类型基准上优于额外监督微调,并在保真度和下游效用之间实现了最佳平均权衡,同时保持经验隐私诊断接近监督基线。
超越模式寻求强化学习:扩散语言模型的轨迹平衡后训练
机构 * Noah’s Ark Lab(Noah’s Ark 实验室)
专题命中 后训练与偏好优化 :language model(title,abstract);post-training(title,abstract);分类 cs.CL、cs.LG
AI总结 本文提出TraFL方法,通过轨迹平衡目标提升扩散语言模型的后训练效果,在多个基准测试中均优于基线模型。
ESSAM:一种用于内存高效的LLM微调的强化学习竞争进化策略方法
机构 * Xi’an Jiaotong University(西安交通大学) ; SGIT AI Lab(SGIT人工智能实验室)
专题命中 后训练与偏好优化 :LLM(title_cn,summary_cn);large language model(abstract);language model(abstract);分类 cs.AI、cs.LG
AI总结 本文提出ESSAM,结合进化策略的零阶搜索与SAM提升泛化能力,实现低内存高精度的LLM微调,实验显示其在GSM8K任务中表现优异,内存使用显著降低。
高效的目标令牌级偏好优化用于基于大语言模型的文本到语音
机构 * SpiralAI Inc.(SpiralAI公司) ; The University of Osaka(大阪大学) ; Shizuoka University(izuoka大学)
专题命中 后训练与偏好优化 :preference optimization(title,abstract);LLM(title);language model(abstract);分类 cs.CL、cs.AI
AI总结 本文提出TKTO方法,通过无需配对数据实现高效训练,直接优化令牌级单位,提升日语音识别准确率39%并降低CER 54%。
Comments Accepted at ACL 2026 (Main)
对齐生成式人工智能与人类偏好:一种用于在线评论管理的新型大语言模型微调方法
机构 * Department of Information Systems and Operations Management, The University of Texas at Arlington(信息系统与运营管理系,德克萨斯大学阿灵顿分校) ; Department of Management Information Systems, University of Arizona(管理信息学系,亚利桑那大学)
专题命中 后训练与偏好优化 :large language model(title);language model(title);LLM(abstract,abstract_cn);分类 cs.CL、cs.AI
AI总结 本文提出一种新型微调方法,通过上下文增强和理论驱动的偏好微调,解决在线评论生成中的幻觉、偏好表示和保守优化问题,提升生成质量。
Comments Accepted to Information Systems Research (ISR). This is a preliminary version
面向增强大语言模型推理能力的分层多步奖励模型
机构 * the University of Hong Kong(香港大学) ; Tsinghua University(清华大学) ; Georgia Institute of Technology(佐治亚理工学院) ; National University of Singapore(新加坡国立大学) ; Zhejiang University(浙江大学) ; Renmin University of China(中国人民大学) ; the Chinese University of Hong Kong(香港中文大学)
专题命中 后训练与偏好优化 :large language model(title,abstract);language model(title,abstract);分类 cs.CL、cs.AI
AI总结 本文提出分层奖励模型和轻量数据增强策略,解决大语言模型推理中奖励黑客问题,提升多步推理评估的稳定性和泛化能力。
通过大语言模型发现强化学习算法的进化方法
机构 * Machine Perception and Interaction Lab, Örebro University(厄勒布鲁大学机器感知与交互实验室)
专题命中 后训练与偏好优化 :large language model(title,abstract);language model(title,abstract);分类 cs.AI、cs.LG
AI总结 本文提出一种基于进化算法发现强化学习算法的方法,通过搜索可执行的更新规则来发现新的算法,并通过超参数优化提升性能,实验表明其在多个基准上表现优异。
Comments accepted at GECCO 2026
大语言模型后训练流程的自动配置
机构 * National University of Singapore(新加坡国立大学)
专题命中 后训练与偏好优化 :LLM(title,abstract);post-training(title,abstract);分类 cs.AI、cs.LG
AI总结 本文提出AutoPipe框架,通过学习历史运行数据和贝叶斯优化,有效配置大语言模型后训练流程,减少计算成本并提升性能。
大型语言模型是否会陷入霍夫斯塔德-莫比乌斯循环?
机构 * Faculty of Mathematics and Computer Science, Jagiellonian University(数学与计算机科学学院,雅盖隆大学)
专题命中 后训练与偏好优化 :language model(title,abstract);large language model(title);RLHF(abstract);分类 cs.CL、cs.AI
AI总结 本文探讨现代RLHF训练语言模型中存在霍夫斯塔德-莫比乌斯循环的矛盾,通过实验发现调整系统提示的框架可显著减少压迫性输出。
Comments 15 pages, 4 figures, 3 tables
PostTrainBench: 大型语言模型代理能否自动化大型语言模型的后训练?
专题命中 后训练与偏好优化 :LLM(title,abstract);post-training(title,abstract);分类 cs.AI、cs.LG
AI总结 PostTrainBench研究LLM代理在受限制计算条件下自主进行后训练的能力,发现其在某些场景下可超越指令调优模型,但也存在奖励黑客等风险。
为何Pass@k优化会损害Pass@1:LLM微调中的提示干扰
机构 * Singapore University of Technology and Design(新加坡科技设计大学) ; University of Maryland, College Park(马里兰大学学院公园分校) ; University of Central Florida(佛罗里达中央大学)
专题命中 后训练与偏好优化 :LLM(title);post-training(title);large language model(abstract);language model(abstract)
AI总结 该研究揭示了在LLM微调中,pass@k优化可能损害pass@1的原因,通过梯度冲突和提示干扰机制,提出了理论解释并验证了实验结果。
Comments updated related work discussion
DFPO:通过分布流扩展价值建模以实现鲁棒且可泛化的LLM后训练
专题命中 后训练与偏好优化 :LLM(title,abstract);post-training(title,abstract);分类 cs.CL、cs.LG
AI总结 DFPO通过分布流扩展价值建模,提升LLM后训练的鲁棒性和泛化能力。
通过非人类样式推理路径偏好优化增强大语言模型推理
机构 * University of Technology Sydney(悉尼技术大学) ; Shanghai Innovation Institute(上海创新研究院) ; Southeast University(东南大学) ; Microsoft Research(微软研究院) ; Nanjing University(南京大学) ; Shanghai Jiao Tong University(上海交通大学) ; Independent Researcher(独立研究者)
专题命中 后训练与偏好优化 :LLM(title,abstract);preference optimization(title,abstract);分类 cs.CL、cs.AI
AI总结 本文提出CGPO方法,通过置信度信号优化推理路径,提升大语言模型在代码和数学推理任务中的性能。
Comments 15 pages
对抗修正:RLHF如何使语言模型在自然对话中忽视外部安全信号
机构 * Felipe Biava Cataneo(独立研究者)
专题命中 后训练与偏好优化 :language model(title,abstract);RLHF(title,abstract);分类 cs.CL、cs.AI
AI总结 RLHF使语言模型在自然对话中忽视外部安全信号,影响安全纠正的有效性。
表征生成大语言模型中的毒性
机构 * Delft University of Technology(代尔夫特理工大学)
专题命中 后训练与偏好优化 :language model(title,abstract);large language model(title);RLHF(abstract);分类 cs.CL、cs.AI
AI总结 本文研究了生成大语言模型在提示下的毒性输出生成程度及影响因素。
DiRL:一种高效的扩散语言模型后训练框架
机构 * Fudan University(复旦大学) ; Shanghai Innovation Institute(上海创新研究院) ; OpenMoss Team(OpenMoss团队)
专题命中 后训练与偏好优化 :language model(title,abstract);post-training(title,abstract);分类 cs.AI、cs.LG
AI总结 DiRL是一种高效的扩散语言模型后训练框架,通过整合FlexAttention加速的分块训练与LMDeploy优化的推理,实现了高效的两阶段后训练,提升了在复杂推理任务如数学中的性能。
M-GRPO:通过动量锚定策略优化稳定大语言模型的自监督强化学习
机构 * Shanghai Innovation Institute(上海创新研究院) ; College of Future Information Technology, Fudan(复旦大学未来信息技术学院) ; Shanghai AI Laboratory(上海人工智能实验室) ; The Chinese University of Hong Kong(香港中文大学)
专题命中 后训练与偏好优化 :large language model(title,abstract);language model(title,abstract);分类 cs.CL、cs.AI
AI总结 M-GRPO通过动量锚定策略优化和IQR过滤方法,稳定大语言模型的自监督强化学习训练,提升训练稳定性和性能。
Comments 7 pages, 5 figures,Accepted NeurIPS 2025 Workshop on Efficient Reasoning