arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

2025-12-02 至 2025-12-02 共收录 13 信号源:cs.CL, cs.AI, cs.LG

1. 后训练与偏好优化 13 篇

2512.00709 2025-12-02 cs.AI 89%

When Human Preferences Flip: An Instance-Dependent Robust Loss for RLHF

当人类偏好翻转时:面向RLHF的实例依赖性鲁棒损失

Yifan Xu, Xichen Ye, Yifan Chen, Qiaosheng Zhang

专题命中 后训练与偏好优化 :RLHF(title,abstract);LLM(abstract);large language model(abstract);language model(abstract)

AI总结 本文提出了一种面向RLHF的实例依赖性鲁棒损失算法,通过建模偏好翻转机制和引入实例依赖的翻转概率,提升对齐算法的鲁棒性。

Comments Accepted by AAAI-26-AIA

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.03492 2025-12-02 cs.LG cs.AI cs.CL 87%

Teaching Language Models to Critique via Reinforcement Learning

通过强化学习教学语言模型进行批评

Zhihui Xie, Jie Chen, Liyu Chen, Weichao Mao, Jingjing Xu, Lingpeng Kong

机构 * The University of Hong Kong(香港大学)

专题命中 后训练与偏好优化 :language model(title,abstract);LLM(abstract);large language model(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文提出CTRL框架,通过强化学习训练批评模型以提升代码生成的准确性和性能,实现迭代改进和误差缓解。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.01775 2025-12-02 cs.LG 85%

How Does RL Post-training Induce Skill Composition? A Case Study on Countdown

强化学习后训练如何诱导技能组合?一个倒计时案例研究

Simon Park, Simran Kaur, Sanjeev Arora

机构 * Princeton Language and Intelligence (PLI), Princeton University(普林斯顿语言与智能研究所(PLI)、普林斯顿大学)

专题命中 后训练与偏好优化 :post-training(title,abstract);large language model(abstract);language model(abstract);分类 cs.LG

AI总结 本研究通过倒计时任务分析强化学习后训练如何诱导技能组合,揭示了模型在不同树结构上的学习顺序和泛化能力差异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.12934 2025-12-02 cs.AI 83%

The Anatomy of Alignment: Decomposing Preference Optimization by Steering Sparse Features

对齐的解剖:通过引导稀疏特征分解偏好优化

Jeremias Ferrao, Matthijs van der Lende, Ilija Lichkovski, Clement Neo

机构 * University of Groningen(格罗宁根大学) AI Safety Initiative Groningen(格罗宁根人工智能安全倡议) Apart Research(Apart研究)

专题命中 后训练与偏好优化 :preference optimization(title,abstract);post-training(abstract);分类 cs.AI

AI总结 本文提出FSRL框架,通过引导稀疏特征来实现透明的偏好优化,揭示模型在风格化呈现上的偏倚,提供可解释的对齐控制方法。

Comments Spotlight at NeurIPS 2025 Mechanistic Interpretability Workshop

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.01331 2025-12-02 cs.RO cs.LG 79%

RobustVLA: Robustness-Aware Reinforcement Post-Training for Vision-Language-Action Models

RobustVLA: 为视觉-语言-动作模型引入鲁棒性感知的强化学习后训练

Hongyin Zhang, Shuo Zhang, Junxi Jin, Qixin Zeng, Runze Li, Donglin Wang

机构 * Westlake University(西湖大学)

专题命中 后训练与偏好优化 :post-training(title,abstract);分类 cs.LG

AI总结 RobustVLA通过引入鲁棒性感知的强化学习后训练方法,提升视觉-语言-动作模型在环境不确定性下的鲁棒性和可靠性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.18624 2025-12-02 cs.CL 79%

Checklists Are Better Than Reward Models For Aligning Language Models

检查表比奖励模型更能对齐语言模型

Vijay Viswanathan, Yanchao Sun, Shuang Ma, Xiang Kong, Meng Cao, Graham Neubig, Tongshuang Wu

机构 * Carnegie Mellon University(卡内基梅隆大学)

专题命中 后训练与偏好优化 :language model(title,abstract);分类 cs.CL

AI总结 本文提出基于检查表反馈的强化学习方法,通过灵活的指令特定准则提升语言模型的指令遵循能力,在多个基准测试中均取得性能提升。

Comments Presented at NeurIPS 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.00425 2025-12-02 cs.CV 78%

What about gravity in video generation? Post-Training Newton's Laws with Verifiable Rewards

视频生成中重力的作用:基于可验证奖励的后训练牛顿定律

Minh-Quan Le, Yuanzhi Zhu, Vicky Kalogeiton, Dimitris Samaras

机构 * Stony Brook University(石溪大学) LIX, École Polytechnique, CNRS, IPP(巴黎政治学院LIX研究所、法国国家科学研究中心、IPPP)

专题命中 后训练与偏好优化 :post-training(title,abstract)

AI总结 NewtonRewards通过可验证奖励机制提升视频生成的物理合理性与运动流畅度。

Comments Project page: https://cvlab-stonybrook.github.io/NewtonRewards

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.23525 2025-12-02 cs.CV 78%

Hallo4: High-Fidelity Dynamic Portrait Animation via Direct Preference Optimization

Hallo4: 通过直接偏好优化实现高保真的动态肖像动画

Jiahao Cui, Yan Chen, Mingwang Xu, Hanlin Shang, Yuxuan Chen, Yun Zhan, Zilong Dong, Yao Yao, Jingdong Wang, Siyu Zhu

机构 * Fudan University(复旦大学) Baidu Inc.(百度公司) Shanghai Innovative Institute(上海创新研究院) Nanjing University(南京大学) Alibaba Group(阿里巴巴集团)

专题命中 后训练与偏好优化 :preference optimization(title,abstract)

AI总结 Hallo4通过直接偏好优化和时空运动调制,实现高保真的动态肖像动画生成,提升唇部同步、表情自然性和身体运动一致性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.20347 2025-12-02 cs.LG cs.AI cs.CL 75%

Soft Adaptive Policy Optimization

软适应策略优化

Chang Gao, Chujie Zheng, Xiong-Hui Chen, Kai Dang, Shixuan Liu, Bowen Yu, An Yang, Shuai Bai, Jingren Zhou, Junyang Lin

机构 * Qwen Team, Alibaba Inc(阿里巴巴公司)

专题命中 后训练与偏好优化 :large language model(abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 SAPO通过软门替代硬剪裁,提升大语言模型强化学习的稳定性和效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.08364 2025-12-02 cs.CL cs.AI 73%

DPRM: A Dual Implicit Process Reward Model in Multi-Hop Question Answering

DPRM: 多跳问答任务中的双隐式过程奖励模型

Xinyi Wang, Yiping Song, Zhiliang Tian, Bo Liu, Tingjin Luo, Minlie Huang

专题命中 后训练与偏好优化 :large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 DPRM通过双隐式过程奖励模型提升多跳问答任务的推理准确性与一致性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.20358 2025-12-02 cs.CL 70%

Dialogue Is Not Enough to Make a Communicative BabyLM (But Neither Is Developmentally Inspired Reinforcement Learning)

对话不足以造就一个交际性的婴儿语言模型(但也不如发展启发式强化学习)

Francesca Padovani, Bastian Bunzeck, Manar Ali, Omar Momen, Arianna Bisazza, Hendrik Buschmeier, Sina Zarrieß

机构 * Center for Language and Cognition (CLCG), University of Groningen(语言与认知中心(CLCG)、格罗宁根大学) CRC 1646 – Linguistic Creativity in Communication, Bielefeld University(语言交流创造性研究(CRC 1646)、比尔特诺夫大学)

专题命中 后训练与偏好优化 :language model(abstract);small language model(abstract);分类 cs.CL

AI总结 本文探讨了仅通过对话数据预训练是否能生成有效的小型语言模型,并通过多种微调策略提升模型的交际能力,发现DPO微调在自定义对话基准测试中表现更优。

Journal ref Proceedings of the First BabyLM Workshop (2025), pp. 421-435

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.08068 2025-12-02 cs.LG 70%

Quantile Reward Policy Optimization: Alignment with Pointwise Regression and Exact Partition Functions

分位数奖励策略优化:与点估计回归和精确分区函数对齐

Simon Matrenok, Skander Moalla, Caglar Gulcehre

机构 * CLAIRE, EPFL(CLAIRE,瑞士联邦理工学院)

专题命中 后训练与偏好优化 :large language model(abstract);language model(abstract);分类 cs.LG

AI总结 QRPO通过分位数奖励实现点绝对奖励学习,保留DPO的简单性和离线适用性,同时提升在聊天和编码任务中的性能。

Comments 58 pages, NeurIPS2025 camera-ready version

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.00050 2025-12-02 cs.RO cs.AI 57%

Reinforcement Learning from Implicit Neural Feedback for Human-Aligned Robot Control

从隐式神经反馈强化学习实现人对齐的机器人控制

Suzie Kim

专题命中 后训练与偏好优化 :RLHF(abstract);分类 cs.AI

AI总结 本文提出利用隐式神经反馈的强化学习框架,通过脑电图信号实现人对齐的机器人控制,实验表明其在复杂任务中表现与人工设计奖励相当。

Comments Master's thesis, Korea University, 2025. arXiv admin note: substantial text overlap with arXiv:2507.13171

详情

展开后加载摘要…

URL PDF HTML 收藏