arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

2026-01-28 至 2026-01-28 共收录 9 信号源:cs.CL, cs.AI, cs.LG

1. 后训练与偏好优化 9 篇

2601.19362 2026-01-28 cs.DC cs.AI 90%

Revisiting Parameter Server in LLM Post-Training

重新审视LLM后训练中的参数服务器

Xinyi Wan, Penghui Qi, Guangxing Huang, Chaoyi Ruan, Min Lin, Jialin Li

机构 * Sea AI Lab(海智实验室) National University of Singapore(新加坡国立大学)

专题命中 后训练与偏好优化 :LLM(title,abstract);post-training(title,abstract);large language model(abstract);language model(abstract)

AI总结 本文提出On-Demand Communication(ODC),通过优化参数服务器在LLM后训练中的应用,有效应对不平衡负载,提升设备利用率和训练效率。

Comments Accepted in ICLR'26

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.11001 2026-01-28 cs.CL cs.AI 87%

DND: Boosting Large Language Models with Dynamic Nested Depth

DND: 通过动态嵌套深度提升大语言模型

Tieyuan Chen, Xiaodong Chen, Haoxing Chen, Zhenzhong Lan, Weiyao Lin, Jianguo Li

机构 * Shanghai Jiao Tong University(上海交通大学) ZhongguanCun Academy(中关村学院) Renmin University of China(中国人民大学) Westlake University(西湖大学)

专题命中 后训练与偏好优化 :large language model(title);language model(title);post-training(abstract);分类 cs.CL、cs.AI

AI总结 DND通过动态嵌套深度机制提升大语言模型性能,通过路由和阈值控制策略优化令牌选择,显著提升密集和MoE模型表现。

Comments Accepted by ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.07981 2026-01-28 cs.CL cs.AI cs.LG stat.ML 85%

Why is Your Language Model a Poor Implicit Reward Model?

为什么你的语言模型是一个差的隐式奖励模型?

Noam Razin, Yong Lin, Jiarui Yao, Sanjeev Arora

机构 * Some Institute(某些研究所)

专题命中 后训练与偏好优化 :language model(title,abstract);post-training(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 研究发现隐式奖励模型(IM-RM)在泛化能力上劣于显式奖励模型(EX-RM),因其更依赖表面token级线索,而设计选择对模型泛化行为有显著影响。

Comments Accepted to ICLR 2026; Code available at https://github.com/princeton-pli/exrm-vs-imrm

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.10530 2026-01-28 cs.AI cs.CL 84%

Is On-Policy Data always the Best Choice for Direct Preference Optimization-based LM Alignment?

基于直接偏好优化的LM对齐中,策略数据是否总是最佳选择?

Zetian Sun, Dongfang Li, Xuhui Chen, Baotian Hu, Min Zhang

机构 * Harbin Institute of Technology, Shenzhen(哈尔滨工业大学(深圳))

专题命中 后训练与偏好优化 :preference optimization(title,abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 本文提出对齐阶段假设,通过理论和实证分析,揭示了静态与策略偏好数据在LM对齐中的效果差异,并提出算法识别对齐阶段边界。

Comments Accepted by ICLR-2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.10139 2026-01-28 cs.CL cs.AI 84%

Unsupervised Elicitation of Language Models

无监督的语言模型引导

Jiaxin Wen, Zachary Ankner, Arushi Somani, Peter Hase, Samuel Marks, Jacob Goldman-Wetzler, Linda Petrini, Henry Sleight, Collin Burns, He He, Shi Feng, Ethan Perez, Jan Leike

机构 * Anthropic Schmidt Sciences New York University(纽约大学) George Washington University(乔治华盛顿大学)

专题命中 后训练与偏好优化 :language model(title,abstract);post-training(abstract);分类 cs.CL、cs.AI

AI总结 本研究提出无监督算法ICM,通过模型自动生成标签来微调语言模型,无需外部监督,在多个任务中表现出色,尤其在超人类能力任务中表现更优。

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.22338 2026-01-28 cs.CL cs.AI 79%

Text2Grad: Reinforcement Learning from Natural Language Feedback

Text2Grad:从自然语言反馈中强化学习

Hanyang Wang, Lu Wang, Chaoyun Zhang, Tianjun Mao, Si Qin, Qingwei Lin, Saravan Rajmohan, Dongmei Zhang

专题命中 后训练与偏好优化 :language model(abstract);RLHF(abstract);prompting(abstract);分类 cs.CL、cs.AI

AI总结 Text2Grad通过将自然语言反馈转化为跨度级梯度,提升语言模型的细粒度对齐和可解释性。

Comments The code for our method is available at https://github.com/microsoft/Text2Grad

Journal ref ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.19063 2026-01-28 cs.CL cs.SD 57%

Optimizing Conversational Quality in Spoken Dialogue Systems with Reinforcement Learning from AI Feedback

通过AI反馈强化学习优化语音对话系统的对话质量

Siddhant Arora, Jinchuan Tian, Jiatong Shi, Hayato Futami, Yosuke Kashiwagi, Emiru Tsunoo, Shinji Watanabe

机构 * Carnegie Mellon University(卡内基梅隆大学) Sony Group Corporation(索尼集团)

专题命中 后训练与偏好优化 :RLHF(abstract);分类 cs.CL

AI总结 本文提出多奖励RLAIF框架,通过结合语义、音频质量和情感一致性奖励,提升语音对话系统的对话质量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.23581 2026-01-28 cs.LG 57%

GraphRAG-R1: Graph Retrieval-Augmented Generation with Process-Constrained Reinforcement Learning

GraphRAG-R1: 基于过程约束强化学习的图检索增强生成

Chuanyue Yu, Kuo Zhao, Yuhan Li, Heng Chang, Mingjian Feng, Xiangzhe Jiang, Yufei Sun, Jia Li, Yuzhi Zhang, Jianxin Li, Ziwei Zhang

机构 * Nankai University(南开大学) Huawei Technologies Ltd(华为技术有限公司) Beihang University(北航)

专题命中 后训练与偏好优化 :LLM(abstract);分类 cs.LG

AI总结 GraphRAG-R1通过过程约束强化学习提升LLM多跳推理能力,结合改进的GRPO方法和两种新型奖励函数,有效解决复杂问题。

Comments Accepted by the Web Conference 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.18824 2026-01-28 cs.GT cs.AI 57%

Differential Voting: Loss Functions For Axiomatically Diverse Aggregation of Heterogeneous Preferences

差异投票:用于异质偏好axiomatically多样聚合的损失函数

Zhiyu An, Duaa Nakshbandi, Wan Du

机构 * University of California, Merced(加州大学梅尔德分校)

专题命中 后训练与偏好优化 :RLHF(abstract);分类 cs.AI

AI总结 差异投票提出了一种统一框架,通过可微损失函数实现异质偏好聚合,支持多种经典投票规则,提升RLHF中偏好聚合的可控性和理论保证。

详情

展开后加载摘要…

URL PDF HTML 收藏