arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

2026-01-14 至 2026-01-14 共收录 8 信号源:cs.CL, cs.AI, cs.LG

1. 后训练与偏好优化 8 篇

2511.21005 2026-01-14 cs.AI cs.IR 87%

ICPO: Intrinsic Confidence-Driven Group Relative Preference Optimization for Efficient Reinforcement Learning

ICPO:内在置信度驱动的群体相对偏好优化用于高效强化学习

Jinpeng Wang, Chao Li, Ting Ye, Mengyuan Zhang, Wei Liu, Jian Luan

机构 * MiLM Plus, Xiaomi Inc.(小米公司)

专题命中 后训练与偏好优化 :preference optimization(title,abstract);LLM(abstract);large language model(abstract);language model(abstract)

AI总结 ICPO通过内在置信度驱动的群体相对偏好优化,提升大型语言模型的推理能力,有效解决粗粒度奖励和奖励噪声问题,增强高质量响应的相对优势。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.14381 2026-01-14 cs.LG cs.AI cs.CL cs.CR 87%

Are My Optimized Prompts Compromised? Exploring Vulnerabilities of LLM-based Optimizers

我的优化提示是否被 compromised?探索基于 LLM 的优化器的漏洞

Andrew Zhao, Reshmi Ghosh, Vitor Carvalho, Emily Lawton, Keegan Hines, Gao Huang, Jack W. Stokes

机构 * Tsinghua University(清华大学) Microsoft(微软)

专题命中 后训练与偏好优化 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 研究发现基于 LLM 的提示优化存在重大安全漏洞,提出假奖励攻击及轻量级防御措施,揭示优化流程为重要攻击目标。

Comments Proceedings of the 19th Conference of the European Chapter of the Association for Computational Linguistics (EACL 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.22462 2026-01-14 cs.AI 81%

Learning "Partner-Aware" Collaborators in Multi-Party Collaboration

在多方协作中学习“伙伴感知”的协作者

Abhijnan Nath, Nikhil Krishnaswamy

专题命中 后训练与偏好优化 :LLM(abstract);large language model(abstract);language model(abstract);RLHF(abstract)

AI总结 本文提出ICR算法,通过学习伙伴感知的协作者,提升多任务协作中的共同基础一致性与解决方案多样性。

Comments Fixed typographic errors in the previous manuscript

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.08777 2026-01-14 cs.LG cs.AI cs.CL cs.GT 80%

Asymptotic Universal Alignment: A New Alignment Framework via Test-Time Scaling

渐近通用对齐:通过测试时间缩放实现的新对齐框架

Yang Cai, Weiqiang Zheng

机构 * Yale University(耶鲁大学)

专题命中 后训练与偏好优化 :large language model(abstract);language model(abstract);post-training(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文提出了一种基于测试时间缩放的通用对齐框架,通过多玩家对齐游戏实现最优鲁棒性,解决了现有方法在输出多样性上的不足。

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.02618 2026-01-14 cs.CL 77%

Alleviating Attention Hacking in Discriminative Reward Modeling through Interaction Distillation

通过交互蒸馏缓解判别奖励建模中的注意力黑客问题

Jianxiang Zang

机构 * College of Computer Science and Artificial Intelligence, Fudan University(计算机科学与人工智能学院,复旦大学)

专题命中 后训练与偏好优化 :large language model(abstract);language model(abstract);RLHF(abstract);分类 cs.CL

AI总结 本文提出交互蒸馏方法,通过优化注意力机制提升判别奖励建模的稳定性与通用性,缓解注意力黑客问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.26167 2026-01-14 cs.AI cs.CL 73%

ToolRM: Towards Agentic Tool-Use Reward Modeling

ToolRM: 向代理工具使用奖励建模迈进

Renhao Li, Jianhong Tu, Yang Su, Yantao Liu, Fei Huang, Hamid Alinejad-Rokny, Derek F. Wong, Junyang Lin, Min Yang

机构 * University of Macau(澳门大学) Qwen Team, Alibaba Inc.(阿里云Qwen团队) UNSW Sydney(新南威尔士大学悉尼分校) Shenzhen Institute of Advanced Technology, Chinese Academy of Sciences(中国科学院深圳先进技术研究所)

专题命中 后训练与偏好优化 :large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 ToolRM通过构建高质量偏好数据集和基准,提升代理AI在工具调用任务中的表现和泛化能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.08237 2026-01-14 cs.AI 70%

The End of Reward Engineering: How LLMs Are Redefining Multi-Agent Coordination

奖励工程的终结:大型语言模型如何重新定义多智能体协调

Haoran Su, Yandong Sun, Congjia Yu

机构 * New York University(纽约大学) Lerna AI

专题命中 后训练与偏好优化 :large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本文探讨了大型语言模型如何通过语义奖励规范和动态适应替代传统奖励工程,重新定义多智能体协调。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.08421 2026-01-14 cs.LG 57%

Coverage Improvement and Fast Convergence of On-policy Preference Learning

策略学习中的覆盖改进与快速收敛

Juno Kim, Jihun Yun, Jason D. Lee, Kwang-Sung Jun

机构 * UC Berkeley(伯克利大学) KRAFTON(KRAFTON公司) University of Arizona(亚利桑那大学)

专题命中 后训练与偏好优化 :language model(abstract);分类 cs.LG

AI总结 本文提出覆盖改进原理,通过分析在线策略学习中的覆盖变化,证明其在批量大小足够时能实现快速收敛,并设计混合采样器和奖励蒸馏方案,提升语言模型对齐性能。

Comments 46 pages, 2 figures, 2 tables

详情

展开后加载摘要…

URL PDF HTML 收藏