Investigating Regularization of Self-Play Language Models
专题命中 后训练与偏好优化 :language model(title,abstract);LLM(abstract);RLHF(abstract);preference optimization(abstract)
AI 大模型
大语言模型、预训练、指令微调、后训练和语言模型应用。
专题命中 后训练与偏好优化 :language model(title,abstract);LLM(abstract);RLHF(abstract);preference optimization(abstract)
专题命中 后训练与偏好优化 :RLHF(title,abstract);large language model(abstract);language model(abstract);preference optimization(abstract)
Comments Accepted by CVPR 2024
专题命中 后训练与偏好优化 :RLHF(title,abstract);large language model(abstract);language model(abstract);SFT(abstract)
专题命中 后训练与偏好优化 :language model(title,abstract);LLM(abstract,comments);large language model(abstract);分类 cs.CL、cs.AI、cs.LG
Comments Website: https://sites.google.com/view/llm-vas
奖励引导自回归图生成的高效多智能体通信拓扑设计
专题命中 后训练与偏好优化 :RLHF(summary_cn,abstract);LLM(abstract,abstract_cn);分类 cs.CL、cs.LG
AI总结 针对多智能体系统通信拓扑设计中 token 消耗过高的问题,本文提出 RGA-Designer 方法,通过结合 RLHF 训练奖励模型微调图生成器,在保持任务准确率的同时降低了 token 消耗。
Comments Full version of extended abstract accepted at ICONIP 2026 (poster)
MCTS-KBQA:基于信息增益奖励的知识库问答蒙特卡洛树搜索
专题命中 后训练与偏好优化 :LLM(summary_cn,abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI
AI总结 该研究针对基于LLM的KBQA中MCTS应用的奖励设计与计算成本问题,提出Fast MCTS方法,以信息增益奖励替代中间状态终端展开,在四个KBQA基准上提升了准确率-成本权衡。
Comments Accepted to CIKM 2026
基于多层组合融合的上下文价值对齐
专题命中 后训练与偏好优化 :LLM(summary_cn);RLHF(abstract,abstract_cn);large language model(abstract);language model(abstract)
AI总结 本研究提出MCF-CVA框架,通过多层组合融合及EAR算法,结合多道德智能体的认知多样性缓解冲突冗余,在标准指标上优于单智能体等基线,提升LLM的上下文价值对齐能力。
Comments 12 pages, 5 figures, 5 tables
SP3O:无需奖励建模的分段偏好强化学习
机构 * University of Michigan(密歇根大学)
专题命中 后训练与偏好优化 :LLM(summary_cn,abstract);RLHF(abstract,abstract_cn);分类 cs.AI、cs.LG
AI总结 SP3O是一种无需奖励建模的新型PbRL算法,利用分段级偏好反馈,通过PPO型损失函数优化策略,在机器人控制和LLM微调等长视界任务中性能优于现有算法。
TLA-Prover: 通过偏好优化低秩适配实现可验证的 TLA+ 规范合成
机构 * Department of Computer Science, Loyola University Chicago(洛约拉芝加哥大学计算机科学系)
专题命中 后训练与偏好优化 :SFT(abstract,abstract_cn);LLM(abstract_cn);large language model(abstract);language model(abstract)
AI总结 提出 TLA-Prover 模型,结合监督微调和基于修复的组相对策略优化,在 TLC 模型检查器上实现 TLA+ 规范合成,Gold/Diamond 级别通过率达 30%,约为未调优基线的 3.5 倍。
Comments 12 pages, 5 tables, 3 figures. In Proceedings at the 21st International Conference on Software Technologies (ICSOFT 2026)
Journal ref ICSOFT 2026, pp. 627-636, 2026
用于人类反馈强化学习的元学习奖励塑形
专题命中 后训练与偏好优化 :RLHF(summary_cn,abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.LG
AI总结 MeRLa是元学习的任务感知奖励塑形框架,在RLHF训练前通过辅助任务元学习塑形函数,可提升LLaMA-3-8B在多基准上的对齐性能,降低训练不稳定性。
TaoSR-AGRL:用于电子商务搜索相关性的自适应引导强化学习框架
机构 * Tsinghua University(清华大学) ; Taobao & Tmall Group of Alibaba(阿里巴巴淘宝与天猫集团) ; Fudan University(复旦大学)
专题命中 后训练与偏好优化 :SFT(abstract,abstract_cn);LLM(abstract);large language model(abstract);language model(abstract)
AI总结 电商搜索中查询-产品相关性预测很关键,现有方法有局限。提出TaoSR-AGRL框架,通过规则感知奖励塑造和自适应引导重放两大创新,提升模型推理能力,在实验中表现优于基线,已成功部署。
Comments Accepted to The Web Conference (WWW) 2026, Industry Track, Oral
Journal ref Proceedings of the ACM Web Conference 2026 (WWW '26), 2026, pp. 7955-7966
ASymPO: 用于异步大语言模型后训练的非对称尺度策略优化(无需行为信息)
机构 * Huawei Technologies(华为技术)
专题命中 后训练与偏好优化 :post-training(title,abstract);LLM(title);分类 cs.AI、cs.LG
AI总结 针对异步强化学习中陈旧响应导致的分布漂移问题,提出非对称尺度策略优化(ASymPO),通过归一化每个响应的令牌损失来恢复零和平衡,无需行为策略概率。
Comments incorrect proofs in the paper
嘿,聊天机器人,你能教我吗?为人类学习构建结构化苏格拉底式对话
机构 * School of Computing and Information Systems, Singapore Management University(新加坡管理大学计算与信息系统学院) ; Department of Management Science and Information Systems, Rutgers Business School(罗格斯大学商学院管理科学与信息系统系)
专题命中 后训练与偏好优化 :LLM(summary_cn,abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI
AI总结 针对LLM在长对话中教学效果差的问题,提出分离课程规划、苏格拉底对话和知识状态推断的系统,使用PPO策略决定教学顺序,在STEM和非STEM主题上优于基线模型。
Comments 10 Main Body Pages, with Appendices
联邦变分偏好对齐与Gumbel-Softmax先验用于个性化用户偏好
机构 * Graduate School of AI, POSTECH, Pohang, Republic of Korea(POSTECH人工智能研究生院) ; Department of CSE, POSTECH, Pohang, Republic of Korea(POSTECH计算机科学与工程系) ; National AI Research Lab, Seoul, Republic of Korea(首尔国家人工智能研究实验室)
专题命中 后训练与偏好优化 :RLHF(summary_cn,abstract);large language model(abstract);language model(abstract);分类 cs.AI、cs.LG
AI总结 提出FedVPA-GP框架,通过联邦混合先验和正交损失解决联邦学习中用户偏好冲突和个性化问题,在HH-RLHF数据集上优于单一模型。
Comments 21 pages, 4 figures. Accepted to ICML 2026
Raon-Speech 技术报告
机构 * KRAFTON
专题命中 后训练与偏好优化 :LLM(abstract,abstract_cn);language model(abstract);foundation model(abstract);post-training(abstract)
AI总结 本文提出 Raon-Speech,一个 9B 参数的语音语言模型,通过多阶段训练实现英语和韩语的语音理解、回答与生成,并扩展为全双工对话模型 Raon-SpeechChat,在语音任务上超越同类模型。
通用偏好强化学习
机构 * Stanford University(斯坦福大学) ; The University of Oklahoma(俄克拉荷马大学)
专题命中 后训练与偏好优化 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);post-training(abstract)
AI总结 本文提出通用偏好强化学习(GPRL),通过引入通用偏好模型(GPM)解决传统强化学习在开放任务中连续探索不足的问题,通过多维偏好比较提升模型性能。
PREFINE: 基于偏好的隐式奖励和成本微调以实现安全对齐
机构 * TCS Research, \ of CSE, IIT Madras India ; Department of Computing Science, \ of Alberta Canada ; Qatar Computing Research Institute, \ Bin Khalifa University Qatar ; Department of Data Science \& AI, Wadhwani School of Data Science \& AI, IIT Madras India ; TCS Research, \ of CSE, IIT Madras ; Department of Computing Science, \ of Alberta ; Qatar Computing Research Institute, \ Bin Khalifa University ; Department of Data Science \& AI, Wadhwani School of Data Science \& AI, IIT Madras
专题命中 后训练与偏好优化 :LLM(abstract,abstract_cn);RLHF(abstract,abstract_cn);language model(abstract);preference optimization(abstract)
AI总结 该研究提出PREFINE方法,通过基于偏好的隐式奖励和成本微调,在连续控制环境中实现安全策略对齐,通过微调预训练强化学习策略以生成低成本行为同时保持高奖励。
Comments Accepted at AAMAS 2026 as a full paper
通过信息论指导消除奖励模型中的归纳偏置
机构 * Qwen Large Model Application Team, Alibaba(阿里巴巴大模型应用团队) ; The Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳)) ; Shenzhen Research Institute of Big Data(深圳大数据研究院)
专题命中 后训练与偏好优化 :RLHF(summary_cn,abstract);large language model(abstract);language model(abstract);分类 cs.AI、cs.LG
AI总结 本文提出了一种基于信息论的奖励模型去偏方法DIR,通过最大化奖励模型评分与人类偏好对之间的互信息,同时最小化奖励模型输出与偏好输入偏置属性之间的互信息,从而有效缓解归纳偏置问题并提升RLHF性能。
Comments Published as a conference paper at The International Conference on Learning Representations (ICLR) 2026
一对GRPO家族的统一:从隐式到显式的偏好约束用于稳定和通用的RL对齐
机构 * Department of Automation, Tsinghua University(清华大学自动化系)
专题命中 后训练与偏好优化 :LLM(abstract,abstract_cn);RLHF(abstract,abstract_cn);large language model(abstract);language model(abstract)
AI总结 本文提出了一种统一的偏好基于RL优化框架,通过Soft-Pair-GRPO和Hard-Pair-GRPO两种变体,解决了主流配对偏好学习中政策更新不稳定、梯度方向模糊等问题,提升了对齐质量与训练稳定性。
ARES: 自适应红队测试与端到端策略-奖励系统修复
机构 * Amazon Nova Responsible AI(亚马逊Nova责任AI)
专题命中 后训练与偏好优化 :LLM(abstract,abstract_cn);RLHF(abstract,abstract_cn);large language model(abstract);language model(abstract)
AI总结 ARES通过自适应红队测试和端到端修复方法,系统发现并缓解策略-奖励系统双重漏洞,提升安全鲁棒性。
Comments 9 pages, ACL 2026 Main
朝着弥合直接对齐算法中的奖励生成差距而努力
机构 * Shanghai University of Finance and Economics(上海财经大学) ; Beihang University(北航) ; Southern University of Science and Technology(南方科技大学)
专题命中 后训练与偏好优化 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);RLHF(abstract)
AI总结 本文探讨了直接对齐算法中奖励生成差距的问题,提出Prefix-Oriented Equal-length Training方法,通过截断响应长度来提升对齐效果,实验显示在AlpacaEval 2上提升显著。
Comments Findings of ACL 2026
基于对齐的DPO:一种原则性的推理方法以提高安全性对齐
机构 * University of Virginia(弗吉尼亚大学) ; Capital One
专题命中 后训练与偏好优化 :large language model(abstract);language model(abstract);post-training(abstract);SFT(abstract)
AI总结 本文提出基于对齐的DPO方法,通过引入推理意识的后训练和对齐加权机制,提升大语言模型的安全性对齐鲁棒性。
DND: 通过动态嵌套深度提升大语言模型
机构 * Shanghai Jiao Tong University(上海交通大学) ; ZhongguanCun Academy(中关村学院) ; Renmin University of China(中国人民大学) ; Westlake University(西湖大学)
专题命中 后训练与偏好优化 :large language model(title);language model(title);post-training(abstract);分类 cs.CL、cs.AI
AI总结 DND通过动态嵌套深度机制提升大语言模型性能,通过路由和阈值控制策略优化令牌选择,显著提升密集和MoE模型表现。
Comments Accepted by ICLR 2026
基于角色的LLM强化学习后训练容错系统
机构 * Zhejiang University(浙江大学) ; State Key Laboratory of Mathematical Engineering and Advanced Computing(数学工程与先进计算国家重点实验室)
专题命中 后训练与偏好优化 :post-training(title,abstract);LLM(title);分类 cs.AI、cs.LG
AI总结 RobustRL通过基于角色的故障隔离技术,有效提升LLM强化学习后训练的容错性能,实现训练时间比率提升80%以上。
Comments 16 pages, 19 figures
机构 * Department of Statistics and Operations Research, UNC-Chapel Hill(统计与运筹学系,北卡罗来纳大学 Chapel Hill 分校) ; Imperial College Business School, Imperial College London(帝国理工学院伦敦校区商学院)
专题命中 后训练与偏好优化 :LLM(abstract);large language model(abstract);language model(abstract);post-training(abstract)
机构 * Alibaba Cloud Computing(阿里云计算)
专题命中 后训练与偏好优化 :large language model(title);language model(title);LLM(abstract);分类 cs.CL、cs.LG
机构 * University of Washington(华盛顿大学) ; Xi’an Jiaotong University(西安交通大学) ; University of Notre Dame(圣母大学) ; Google(谷歌)
专题命中 后训练与偏好优化 :post-training(title,abstract);LLM(title);分类 cs.CL、cs.LG
Comments 8 pages, 1 figures, 2 tables. Experimental code and results are publicly available at https://anonymous.4open.science/r/Graph_RL-BF08/readme.md
机构 * Zhejiang University(浙江大学) ; Hongkong Polytechnic University(香港理工大学) ; University College London(伦敦大学学院) ; Westlake University(西湖大学) ; King's College London(国王学院) ; Southern University of Science and Technology(南方科技大学)
专题命中 后训练与偏好优化 :LLM(abstract);large language model(abstract);language model(abstract);post-training(abstract)
Journal ref ICML 2025
机构 * Faculty of Engineering(工程学院)
专题命中 后训练与偏好优化 :language model(title,abstract);post-training(title);分类 cs.CL、cs.AI
Comments PhD Thesis
专题命中 后训练与偏好优化 :post-training(title,abstract);language model(title);分类 cs.CL、cs.AI
Comments ACL 2023 Main Conference (Short Paper)