arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

2026-03-04 至 2026-03-04 共收录 10 信号源:cs.CL, cs.AI, cs.LG

1. 后训练与偏好优化 10 篇

2504.21023 2026-03-04 cs.CL cs.AI cs.LG 90%

Param$Δ$ for Direct Weight Mixing: Post-Train Large Language Model at Zero Cost

ParamΔ 用于直接权重混合:零成本的后训练大语言模型

Sheng Cao, Mingrui Wu, Karthik Prasad, Yuandong Tian, Zechun Liu

专题命中 后训练与偏好优化 :large language model(title,abstract);language model(title,abstract);post-training(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 ParamΔ通过零成本方法实现基础模型的后训练能力迁移,提升模型性能与开发效率。

Comments Published as a conference paper at ICLR 2025

Journal ref ICLR 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.02229 2026-03-04 cs.LG cs.CL 86%

Safety Training Persists Through Helpfulness Optimization in LLM Agents

在LLM代理中通过帮助性优化保持安全性训练

Benjamin Plaut

机构 * Department of Computer Science, University of California, Berkeley, USA(计算机科学系,加州大学伯克利分校)

专题命中 后训练与偏好优化 :LLM(title,abstract);post-training(abstract);preference optimization(abstract);分类 cs.CL、cs.LG

AI总结 研究通过帮助性优化在LLM代理中保持安全性训练,发现单独训练或依次训练无法找到最佳策略,但所有配置接近帕累托前沿。

Comments Under submission

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.06084 2026-03-04 cs.CL cs.AI 84%

Spectrum Tuning: Post-Training for Distributional Coverage and In-Context Steerability

频谱调节:面向分布覆盖和上下文可引导性的后训练

Taylor Sorensen, Benjamin Newman, Jared Moore, Chan Park, Jillian Fisher, Niloofar Mireshghallah, Liwei Jiang, Yejin Choi

机构 * University of Washington(华盛顿大学) Stanford University(斯坦福大学) Microsoft Research(微软研究院) Carnegie Mellon University(卡内基梅隆大学)

专题命中 后训练与偏好优化 :post-training(title,abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 本文提出Spectrum Tuning方法,通过Spectrum Suite提升模型在多样化分布下的引导能力和输出空间覆盖性。

Comments ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.02701 2026-03-04 cs.CL 77%

Graph-GRPO: Stabilizing Multi-Agent Topology Learning via Group Relative Policy Optimization

图GRPO:通过群体相对策略优化稳定多智能体拓扑学习

Yueyang Cang, Xiaoteng Zhang, Erlu Zhao, Zehua Ji, Yuhang Liu, Yuchen He, Zhiyuan Ning, Chen Yijun, Wenge Que, Li Shi

机构 * Tsinghua University(清华大学) Donghua University(东华大学)

专题命中 后训练与偏好优化 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 图GRPO通过群体相对策略优化稳定多智能体拓扑学习,提升训练稳定性并识别关键通信路径。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.03000 2026-03-04 cs.LG cs.AI 73%

Why Does RLAIF Work At All?

为什么RLAIF真的有效?

Robin Young

机构 * Department of Computer Science and Technology University of Cambridge(计算机科学与技术系剑桥大学)

专题命中 后训练与偏好优化 :language model(abstract);pretraining(abstract);分类 cs.AI、cs.LG

AI总结 本文提出潜在价值假设,解释RLAIF通过激活预训练编码的价值方向实现自我改进,并统一了相关实证发现。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.02232 2026-03-04 cs.LG cs.AI 73%

Beyond Binary Preferences: A Principled Framework for Reward Modeling with Ordinal Feedback

超越二元偏好:基于顺序反馈的奖励建模原理框架

Amirhossein Afsharrad, Ruida Zhou, Luca Viano, Sanjay Lall, Mohammad Ghavamzadeh

机构 * Stanford University(斯坦福大学) Amazon AGI(亚马逊人工智能研究) EPFL(瑞士联邦理工学院) Qualcomm AI Research(高通人工智能研究) Aktus AI

专题命中 后训练与偏好优化 :large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 本文提出基于顺序反馈的奖励建模原理框架,通过离散顺序回归方法,学习阈值参数以捕捉偏好顺序结构,实现更有效的细粒度人类反馈利用。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.03258 2026-03-04 cs.AI 70%

Inherited Goal Drift: Contextual Pressure Can Undermine Agentic Goals

继承性目标漂移:情境压力可能削弱代理目标

Achyutha Menon, Magnus Saebo, Tyler Crosse, Spencer Gibson, Eyon Jang, Diogo Cruz

机构 * UC San Diego(加州大学圣地亚哥分校) Columbia University(哥伦比亚大学) Georgia Tech(佐治亚理工学院) MATS SPAR

专题命中 后训练与偏好优化 :language model(abstract);post-training(abstract);分类 cs.AI

AI总结 本文研究了语言模型在面对情境压力时目标漂移的继承性问题,发现模型在不同环境下表现出不一致的鲁棒性,强调了对训练后技术改进的必要性。

Comments 22 pages, 7 figures. Accepted at ICLR 2026 Lifelong Agents Workshop

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.03198 2026-03-04 cs.RO cs.CL cs.CV 70%

ACE-Brain-0: Spatial Intelligence as a Shared Scaffold for Universal Embodiments

ACE-Brain-0:空间智能作为通用具身化体系的共享框架

Ziyang Gong, Zehang Luo, Anke Tang, Zhe Liu, Shi Fu, Zhi Hou, Ganlin Yang, Weiyun Wang, Xiaofeng Wang, Jianbo Liu, Gen Luo, Haolan Kang, Shuang Luo, Yue Zhou, Yong Luo, Li Shen, Xiaosong Jia, Yao Mu, Xue Yang, Chunxiao Liu, Junchi Yan, Hengshuang Zhao, Dacheng Tao, Xiaogang Wang

机构 * Shanghai Jiao Tong University(上海交通大学) Nanyang Technological University(南洋理工大学) The Chinese University of Hong Kong(香港中文大学) The University of Hong Kong(香港大学) University of Science(科学技术大学) Fudan University(复旦大学) Xiamen University(厦门大学) East China Normal University(华东师范大学) Wuhan University(武汉大学) Sun Yat-sen University(中山大学)

专题命中 后训练与偏好优化 :large language model(abstract);language model(abstract);分类 cs.CL

AI总结 ACE-Brain-0 通过空间智能作为共享框架,统一了自动驾驶、机器人和 UAVs 的具身化任务,采用 SSR 范式和 GRPO 方法实现跨领域泛化和领域精通的平衡。

Comments Code: https://github.com/ACE-BRAIN-Team/ACE-Brain-0 Hugging Face: https://huggingface.co/ACE-Brain/ACE-Brain-0-8B

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.02675 2026-03-04 cs.LG 70%

From Shallow to Deep: Pinning Semantic Intent via Causal GRPO

从浅层到深层:通过因果GRPO固定语义意图

Shuyi Zhou, Zeen Song, Wenwen Qiang, Jiyan Sun, Yao Zhou, Yinlong Liu, Wei Ma

专题命中 后训练与偏好优化 :large language model(abstract);language model(abstract);分类 cs.LG

AI总结 通过因果GRPO框架,解决大型语言模型对对抗性前缀攻击的脆弱性问题,实现意图固定以提升安全性和鲁棒性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.01352 2026-03-04 cs.CL cs.AI cs.LG 67%

Skywork-Reward-V2: Scaling Preference Data Curation via Human-AI Synergy

Skywork-Reward-V2: 通过人机协同扩大偏好数据整理

Chris Yuhao Liu, Liang Zeng, Yuzhen Xiao, Jujie He, Jiacai Liu, Chaojie Wang, Rui Yan, Wei Shen, Fuxiang Zhang, Jiacheng Xu, Yang Liu, Yahui Zhou

机构 * Research, Skywork AI(2050研究, Skywork AI)

专题命中 后训练与偏好优化 :RLHF(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 Skywork-Reward-V2通过人机协同扩大偏好数据整理,提出SynPref-40M数据集和两阶段流程,训练出八种参数不同的奖励模型,在多个基准中取得最佳性能。

Comments ICLR 2026 Poster

详情

展开后加载摘要…

URL PDF HTML 收藏