arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

共收录 4556 信号源:cs.CL, cs.AI, cs.LG

1. 后训练与偏好优化 4556 篇

2503.00539 2026-06-30 cs.LG cs.AI cs.CL 83%

Distributionally Robust Reinforcement Learning with Human Feedback

具有人类反馈的分布鲁棒强化学习

Debmalya Mandal, Paulius Sasnauskas, Goran Radanovic

专题命中 后训练与偏好优化 :large language model(abstract);language model(abstract);RLHF(abstract);preference optimization(abstract)

AI总结 本文提出一种分布鲁棒的强化学习方法,通过改进奖励基强化学习和直接偏好优化,提升模型在分布变化时的鲁棒性,实验显示在非分布任务中性能显著提升。

Comments Accepted at ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.26269 2026-06-05 cs.CL cs.AI cs.LG 83%

Calibrated Surprise: An Information-Theoretic Account of Creative Quality

校准的惊喜:一种信息论视角下的创造性质量

Bo Zou, Chao Xu

机构 * Bo Zou(邹波) Chao Xu(徐超)

专题命中 后训练与偏好优化 :RLHF(abstract,abstract_cn);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文提出了一种信息论框架,用于评估创造性写作的质量,通过校准的惊喜概念,结合香农互信息理论,量化了高质量文本与降质文本之间的差异。

Comments 28 pages, 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.04284 2026-06-04 cs.LG cs.AI cs.CL 83%

Sparse Mixture-of-Experts Reward Models Learn Interpretable and Specialized Experts for Personalized Preference Modeling

稀疏混合专家奖励模型学习可解释且专业化的专家用于个性化偏好建模

Yifan Wang, Jinyi Mu, Mayank Jobanputra, Yu Wang, Ji-Ung Lee, Soyoung Oh, Isabel Valera, Vera Demberg

机构 * Saarland University(萨尔兰大学) Independent Researcher(独立研究者) Bielefeld University(比勒菲尔德大学) Max Planck Institute for Software Systems(马克斯·普朗克软件系统研究所) Max Planck Institute for Informatics(马克斯·普朗克信息研究所)

专题命中 后训练与偏好优化 :RLHF(abstract,abstract_cn);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 提出稀疏混合专家奖励模型,通过稀疏路由和专家多样性训练,从二元偏好数据中学习可解释的专家模式,提升个性化偏好建模的测试时适应性和可解释性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.01811 2026-06-02 cs.CL cs.AI cs.LG 83%

"I've Seen How This Goes": Characterizing Diversity via Progressive Conditional Surprise

“我知道这会如何发展”:通过渐进条件惊奇度刻画多样性

Matthew Khoriaty, David Williams-King, Shi Feng

机构 * University of California, Berkeley(加州大学伯克利分校) University of Cambridge(剑桥大学) Stanford University(斯坦福大学)

专题命中 后训练与偏好优化 :SFT(abstract,abstract_cn);language model(abstract);post-training(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 提出一种基于上下文学习的多样性度量方法 Decan(D_{Ca_n}),通过单次前向传递计算每个字节的得分,无需嵌入模型、参考语料或人工标注,在多个基准上验证了其有效性。

Comments 28 pages, 18 figures, 9 tables. Accepted to the Workshop on Generative AI, Creativity, and Human-AI Co-Creation @ ICML 2026 (non-archival). Code and data: https://github.com/AMindToThink/icl-diversity

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.09692 2026-06-02 cs.LG cs.AI cs.CL 83%

ActiveUltraFeedback: Efficient Preference Data Generation using Active Learning

ActiveUltraFeedback:使用主动学习的高效偏好数据生成

Davit Melikidze, Marian Schneider, Jessica Lam, Martin Wertich, Ido Hakimi, Barna Pásztor, Andreas Krause

机构 * University of Freiburg(弗赖堡大学)

专题命中 后训练与偏好优化 :RLHF(abstract,abstract_cn);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 提出ActiveUltraFeedback主动学习流水线,通过不确定性估计和两种新采样方法(DRTS和DeltaUCB)动态选择最具信息量的响应对,以最少六分之一的标注数据实现与静态基线相当或更优的下游性能。

Comments 40 pages, 9 figures, 26 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.29307 2026-05-29 cs.CL cs.AI cs.IR cs.LG 83%

GrepSeek: Training Search Agents for Direct Corpus Interaction

GrepSeek:训练用于直接语料库交互的搜索代理

Alireza Salemi, Chang Zeng, Atharva Nijasure, Jui-Hui Chung, Razieh Rahimi, Fernando Diaz, Hamed Zamani

机构 * University of Massachusetts Amherst(马萨诸塞大学阿默斯特分校) Princeton University(普林斯顿大学) Carnegie Mellon University(卡内基梅隆大学)

专题命中 后训练与偏好优化 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 提出GrepSeek,一种通过两阶段训练(冷启动数据集+GRPO优化)和语义保持的分片并行执行引擎,训练紧凑型搜索代理直接与文本语料库交互(通过shell命令),在开放域问答中取得最优F1和精确匹配。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.09117 2026-05-28 cs.LG cs.AI cs.CL 83%

Decoupling Reasoning and Confidence: Resurrecting Calibration in Reinforcement Learning from Verifiable Rewards

解耦推理与置信度:在可验证奖励的强化学习中恢复校准

Zhengzhao Ma, Xueru Wen, Boxi Cao, Yaojie Lu, Hongyu Lin, Jinglin Yang, Min He, Xianpei Han, Le Sun

机构 * Chinese Information Processing Laboratory, Institute of Software, Chinese Academy of Sciences, Beijing, China(中国科学院软件研究所信息处理实验室) University of Chinese Academy of Sciences, Beijing, China(中国科学院大学) Institute of Information Engineering, Chinese Academy of Sciences, Beijing, China(中国科学院信息工程研究所) School of Cyber Security, University of Chinese Academy of Sciences, Beijing, China(中国科学院大学网络安全学院) National Computer Network Emergency Response Technical Team/Coordination Center of China, Beijing, China(中国国家计算机网络应急技术配合中心)

专题命中 后训练与偏好优化 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 针对RLVR中模型校准退化问题,提出DCPO框架通过解耦推理与校准目标,在保持准确率的同时显著改善校准性能并缓解过度自信。

Comments Accepted at the 43rd International Conference on Machine Learning (ICML 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.02495 2026-05-26 cs.CL cs.AI cs.LG 83%

Reward-free Alignment for Conflicting Objectives

无奖励的冲突目标对齐

Peter Chen, Xiaopeng Li, Xi Chen, Tianyi Lin

机构 * Columbia University(哥伦比亚大学)

专题命中 后训练与偏好优化 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 提出RACO框架,通过冲突规避梯度下降的裁剪变体直接利用成对偏好数据解决多目标冲突,实现帕累托最优对齐。

Comments Accepted to ICML 2026 (Oral)

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.22817 2026-05-22 cs.LG cs.AI cs.CL cs.NE 83%

Vector Policy Optimization: Training for Diversity Improves Test-Time Search

向量策略优化:为多样性训练改进测试时间搜索

Ryan Bahlous-Boldi, Isha Puri, Idan Shenfeld, Akarsh Kumar, Mehul Damani, Sebastian Risi, Omar Khattab, Zhang-Wei Hong, Pulkit Agrawal

机构 * MIT(麻省理工学院) Improbable AI Lab(Improbable AI 实验室) MIT-IBM Computing Research Lab(麻省理工-IBM 计算研究实验室) Sakana AI

专题命中 后训练与偏好优化 :LLM(abstract,abstract_cn);language model(abstract);post-training(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文提出向量策略优化(VPO)方法,通过训练策略以预测多样化的下游奖励函数,从而产生多样化的解决方案,以改进测试时间搜索的性能。

Comments 24 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.21654 2026-05-22 cs.LG cs.AI cs.CL 83%

Value-Gradient Hypothesis of RL for LLMs

强化学习中大语言模型的价值-梯度假说

Arip Asadulaev, Daniil Ognev, Karim Salta, Martin Takac

机构 * MBZUAI(穆斯林人工智能研究所)

专题命中 后训练与偏好优化 :LLM(abstract);language model(abstract);pretraining(abstract);post-training(abstract)

AI总结 本文提出了一种价值-梯度视角来解释无评论强化学习方法在大语言模型后训练中的有效性,并通过分析actor更新和注意力机制中的自适应微分,提出了价值梯度信号和可达奖励空间的分解方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.07503 2026-05-11 cs.CV 83%

Diffusion-APO: Trajectory-Aware Direct Preference Alignment for Video Diffusion Transformers

Diffusion-APO:基于轨迹的直接偏好对齐用于视频扩散变换器

Jingyuan Zhu, Biaolong Chen, Le Zhang, Aixi Zhang, Hao Jiang, Pipei Huang

机构 * Alibaba Group(阿里巴巴集团)

专题命中 后训练与偏好优化 :RLHF(summary_cn,abstract);preference optimization(abstract)

AI总结 本文提出Diffusion-APO,通过同步训练噪声与推理时的去噪路径,解决视频扩散模型与人类意图对齐的问题,采用统一的RLHF框架实现灵活的多阶段偏好对齐,提升视觉质量和指令遵循性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.12272 2026-05-01 cs.LG cs.AI cs.CL 83%

Learning to Reason at the Frontier of Learnability

在可学习性前沿的学习推理

Thomas Foster, Anya Sims, Johannes Forkel, Mattie Fellows, Jakob Foerster

机构 * DeepSeek-R1 Tulu OpenAI

专题命中 后训练与偏好优化 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文提出通过可学习性采样方法优化大语言模型强化学习阶段,提升训练效率和效果,针对高变异性问题进行课程学习。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.10009 2026-03-12 cs.LG cs.AI cs.CL 83%

Personalized Group Relative Policy Optimization for Heterogenous Preference Alignment

面向异质偏好对齐的个性化群体相对策略优化

Jialu Wang, Heinrich Peters, Asad A. Butt, Navid Hashemi, Alireza Hashemi, Pouya M. Ghari, Joseph Hoover, James Rae, Morteza Dehghani

专题命中 后训练与偏好优化 :large language model(abstract);language model(abstract);post-training(abstract);RLHF(abstract)

AI总结 本文提出个性化GRPO框架,通过解耦优势估计与批次统计,提升模型对异质偏好信号的对齐能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.24040 2026-03-02 cs.LG cs.AI cs.CL 83%

RewardUQ: A Unified Framework for Uncertainty-Aware Reward Models

RewardUQ:一种用于不确定性感知奖励模型的统一框架

Daniel Yang, Samuel Stante, Florian Redhardt, Lena Libon, Parnian Kassraie, Ido Hakimi, Barna Pásztor, Andreas Krause

专题命中 后训练与偏好优化 :LLM(abstract);large language model(abstract);language model(abstract);post-training(abstract)

AI总结 RewardUQ提出了一种统一框架,用于系统评估奖励模型的不确定性量化,通过比较常用方法和提出新排序策略,揭示模型大小和初始化对性能的影响,并开源框架促进新方法的发展和应用。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.06238 2026-01-13 cs.LG cs.AI cs.CL 83%

SPINAL -- Scaling-law and Preference Integration in Neural Alignment Layers

SPINAL -- 神经对齐层中的缩放律与偏好整合

Arion Das, Partha Pratim Saha, Amit Dhanda, Vinija Jain, Aman Chadha, Amitava Das

专题命中 后训练与偏好优化 :large language model(abstract);language model(abstract);RLHF(abstract);preference optimization(abstract)

AI总结 SPINAL通过分析神经对齐层的几何特性,量化对齐在深度层的集中表现及稳定性变化。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.21506 2025-12-29 cs.LG cs.AI cs.CL cs.HC 83%

MotionTeller: Multi-modal Integration of Wearable Time-Series with LLMs for Health and Behavioral Understanding

MotionTeller: 多模态整合可穿戴时间序列与大语言模型用于健康和行为理解

Aiwei Zhang, Arvind Pillai, Andrew Campbell, Nicholas C. Jacobson

专题命中 后训练与偏好优化 :LLM(abstract);large language model(abstract);language model(abstract);post-training(abstract)

AI总结 MotionTeller通过整合可穿戴时间序列与大语言模型,实现高精度的自然语言行为摘要生成,提升健康和行为理解的效率与准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.18127 2025-12-17 cs.IR cs.AI cs.CL cs.LG 83%

Holistic Utility Preference Learning for Listwise Alignment

整体效用偏好学习用于列表对齐

Jiacong Zhou, Xianyun Wang, Min Zhang, Jun Yu

机构 * School of Computer Science and Technology, Hangzhou Dianzi University(计算机科学与技术学院,杭州电子科技大学) Harbin Institute of Technology(哈尔滨工业大学)

专题命中 后训练与偏好优化 :large language model(abstract);language model(abstract);RLHF(abstract);preference optimization(abstract)

AI总结 DRPO通过整体效用学习提升列表对齐效果,优化响应排名质量

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.01758 2025-11-04 cs.LG cs.AI cs.CL 83%

RLAC: Reinforcement Learning with Adversarial Critic for Free-Form Generation Tasks

Mian Wu, Gavin Zhang, Sewon Min, Sergey Levine, Aviral Kumar

机构 * Shanghai Jiao Tong University(上海交通大学) UC Berkeley(加州大学伯克利分校) Carnegie Mellon University(卡内基梅隆大学)

专题命中 后训练与偏好优化 :LLM(abstract);large language model(abstract);language model(abstract);post-training(abstract)

Comments Project page: https://mianwu01.github.io/RLAC_website/

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.03742 2025-09-03 cs.CL cs.AI cs.LG 83%

Beyond Scalar Reward Model: Learning Generative Judge from Preference Data

Ziyi Ye, Xiangsheng Li, Qiuchi Li, Qingyao Ai, Yujia Zhou, Wei Shen, Dong Yan, Yiqun Liu

机构 * Department of Computer Science and Technology, Tsinghua University(清华大学计算机科学与技术系) Baichuan AI(拜智科技) University of Copenhagen(哥本哈根大学)

专题命中 后训练与偏好优化 :LLM(abstract);large language model(abstract);language model(abstract);preference optimization(abstract)

Journal ref The Thirteenth International Conference on Learning Representations 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.15717 2025-06-23 cs.LG cs.AI cs.CL 83%

daDPO: Distribution-Aware DPO for Distilling Conversational Abilities

Zhengze Zhang, Shiqi Wang, Yiqun Shen, Simin Guo, Dahua Lin, Xiaoliang Wang, Nguyen Cam-Tu, Fei Tan

机构 * State Key Laboratory for Novel Software Technology, Nanjing University(南京大学新型软件技术国家重点实验室) School of Artificial Intelligence, Nanjing University(南京大学人工智能学院) University of Chicago(芝加哥大学) The Chinese University of Hong Kong(香港中文大学) East China Normal University(华东师范大学)

专题命中 后训练与偏好优化 :LLM(abstract);large language model(abstract);language model(abstract);preference optimization(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.17017 2025-06-11 cs.CV cs.AI cs.CL cs.LG 83%

Delving into RL for Image Generation with CoT: A Study on DPO vs. GRPO

Chengzhuo Tong, Ziyu Guo, Renrui Zhang, Wenyu Shan, Xinyu Wei, Zhenghao Xing, Hongsheng Li, Pheng-Ann Heng

机构 * CUHK(香港中文大学) MiuLar Lab(MiuLar 实验室) MMLab Peking University(北京大学) Shanghai AI Lab(上海人工智能实验室)

专题命中 后训练与偏好优化 :LLM(abstract);large language model(abstract);language model(abstract);preference optimization(abstract)

Comments Code is released at https://github.com/ZiyuGuo99/Image-Generation-CoT

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.01725 2025-06-03 cs.CV 83%

VideoCap-R1: Enhancing MLLMs for Video Captioning via Structured Thinking

Desen Meng, Rui Huang, Zhilin Dai, Xinhao Li, Yifan Xu, Jun Zhang, Zhenpeng Huang, Meng Zhang, Lingshu Zhang, Yi Liu, Limin Wang

机构 * Nanjing University(南京大学) Shanghai AI Laboratory(上海人工智能实验室) Honor Device Co., Ltd(荣誉设备有限公司)

专题命中 后训练与偏好优化 :LLM(abstract);large language model(abstract);language model(abstract);post-training(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2404.16792 2025-06-02 cs.LG cs.AI cs.CL 83%

Model Extrapolation Expedites Alignment

Chujie Zheng, Ziqi Wang, Heng Ji, Minlie Huang, Nanyun Peng

机构 * The CoAI Group, DCST, BNRist, Tsinghua University(清华大学)

专题命中 后训练与偏好优化 :LLM(abstract);large language model(abstract);language model(abstract);SFT(abstract)

Comments ACL 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.12678 2025-05-27 cs.LG cs.AI cs.CL 83%

Multi-Step Alignment as Markov Games: An Optimistic Online Gradient Descent Approach with Convergence Guarantees

Yongtao Wu, Luca Viano, Yihang Chen, Zhenyu Zhu, Kimon Antonakopoulos, Quanquan Gu, Volkan Cevher

专题命中 后训练与偏好优化 :large language model(abstract);language model(abstract);RLHF(abstract);preference optimization(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2407.00617 2025-03-04 cs.LG cs.AI cs.CL cs.GT 83%

Iterative Nash Policy Optimization: Aligning LLMs with General Preferences via No-Regret Learning

Yuheng Zhang, Dian Yu, Baolin Peng, Linfeng Song, Ye Tian, Mingyue Huo, Nan Jiang, Haitao Mi, Dong Yu

专题命中 后训练与偏好优化 :large language model(abstract);language model(abstract);SFT(abstract);RLHF(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.00581 2025-02-25 cs.CL cs.AI cs.LG 83%

Are the Values of LLMs Structurally Aligned with Humans? A Causal Perspective

Yipeng Kang, Junqi Wang, Yexin Li, Mengmeng Wang, Wenming Tu, Quansen Wang, Hengli Li, Tingjun Wu, Xue Feng, Fangwei Zhong, Zilong Zheng

专题命中 后训练与偏好优化 :large language model(abstract);language model(abstract);RLHF(abstract);prompting(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2406.07327 2025-02-10 cs.AI cs.CL cs.LG 83%

3D-Properties: Identifying Challenges in DPO and Charting a Path Forward

Yuzi Yan, Yibo Miao, Jialian Li, Yipin Zhang, Jian Xie, Zhijie Deng, Dong Yan

专题命中 后训练与偏好优化 :LLM(abstract);large language model(abstract);language model(abstract);preference optimization(abstract)

Journal ref ICLR 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2409.18417 2024-12-13 cs.LG cs.AI cs.CL cs.GT econ.GN q-fin.EC 83%

VickreyFeedback: Cost-efficient Data Construction for Reinforcement Learning from Human Feedback

Guoxi Zhang, Jiuding Duan

专题命中 后训练与偏好优化 :LLM(abstract);large language model(abstract);language model(abstract);RLHF(abstract)

Comments 16 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2405.01481 2024-09-04 cs.CL cs.AI cs.LG 83%

NeMo-Aligner: Scalable Toolkit for Efficient Model Alignment

Gerald Shen, Zhilin Wang, Olivier Delalleau, Jiaqi Zeng, Yi Dong, Daniel Egert, Shengyang Sun, Jimmy Zhang, Sahil Jain, Ali Taghibakhshi, Markel Sanz Ausin, Ashwath Aithal, Oleksii Kuchaiev

专题命中 后训练与偏好优化 :large language model(abstract);language model(abstract);RLHF(abstract);preference optimization(abstract)

Comments 16 pages, 4 figures, Accepted to COLM 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2407.02119 2024-07-10 cs.LG cs.AI cs.CL 83%

Cost-Effective Proxy Reward Model Construction with On-Policy and Active Learning

Yifang Chen, Shuohang Wang, Ziyi Yang, Hiteshi Sharma, Nikos Karampatziakis, Donghan Yu, Kevin Jamieson, Simon Shaolei Du, Yelong Shen

专题命中 后训练与偏好优化 :large language model(abstract);language model(abstract);RLHF(abstract);preference optimization(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏