arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

共收录 4541 信号源:cs.CL, cs.AI, cs.LG

1. 后训练与偏好优化 4541 篇

2605.11632 2026-06-05 cs.CL cs.AI 89%

Macro: Enhancing Multilingual Counterfactual Explanations through Alignment-as-Preference Optimization

Macro: 通过偏好对齐优化提升多语言反事实解释

Yilong Wang, Qianli Wang, Bohao Chu, Yihong Liu, Jing Yang, Simon Ostermann

机构 * Technische Universität Berlin(柏林技术大学) German Research Center for Artificial Intelligence (DFKI)(德国人工智能研究中心) University of Duisburg-Essen(杜伊斯堡- Essen大学) LMU Munich(慕尼黑大学) Munich Center for Machine Learning (MCML)(慕尼黑机器学习中心) Saarland Informatics Campus(萨尔兰州信息学校区) BIFOLD – Berlin Institute for the Foundations of Learning and Data(柏林学习与数据基础研究院) Centre for European Research in Trusted AI (CERTAIN)(可信人工智能欧洲研究中心)

专题命中 后训练与偏好优化 :preference optimization(title,abstract);LLM(abstract,abstract_cn);large language model(abstract);language model(abstract)

AI总结 本文提出Macro框架,通过直接偏好优化改进多语言反事实解释,提升有效性的同时保持最小性,避免翻译基线的严重最小性问题,并在多个指标上优于监督微调方法。

Comments In submission

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.10623 2026-06-02 cs.LG cs.AI 89%

Mitigating Reward Hacking in RLHF via Bayesian Non-negative Reward Modeling

通过贝叶斯非负奖励建模缓解RLHF中的奖励黑客

Zhibin Duan, Guowei Rong, Zhuo Li, Bo Chen, Mingyuan Zhou, Dandan Guo

机构 * Zhejiang University(浙江大学)

专题命中 后训练与偏好优化 :RLHF(title,title_cn);LLM(abstract_cn);large language model(abstract);language model(abstract)

AI总结 提出贝叶斯非负奖励模型(BNRM),通过非负因子分析和变分推断,在Bradley-Terry偏好模型中实现解耦与去偏,有效缓解奖励过度优化,提升鲁棒性和可解释性。

Comments Accepted as an Oral presentation at ICML 2026. The code is available at https://github.com/GuoweiRong/Bayesian-Non-negative-Reward-Model

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.05342 2026-06-02 cs.LG cs.AI 89%

Margin Adaptive DPO: Leveraging Reward Model for Granular Control in Preference Optimization

Margin Adaptive DPO: 利用奖励模型实现偏好优化中的细粒度控制

Hyung Gyu Rho

机构 * Independent Researcher(独立研究者)

专题命中 后训练与偏好优化 :preference optimization(title,summary_cn);large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 提出Margin-Adaptive Direct Preference Optimization (MADPO)方法,通过奖励模型估计偏好边界并自适应调整DPO损失权重,实现实例级别的细粒度控制,在摘要任务上优于现有方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.26646 2026-05-27 cs.AI cs.CL cs.MA 89%

UnityMAS-O: A General RL Optimization Framework for LLM-Based Multi-Agent Systems

UnityMAS-O: 基于LLM的多智能体系统的通用强化学习优化框架

Yiqun Chen, Wei Yang, Erhan Zhang, Shijie Wang, Qi Liu, Zechun Niu, Bin Zhang, Haitao Li, Rui Li, Lingyong Yan, Jinyuan Feng, Biqing Qi, Xiaochi Wei, Yan Gao, Yi Wu, Yao Hu, Jiaxin Mao

机构 * Renmin University of China(中国人民大学) Xiaohongshu Inc.(小红书公司)

专题命中 后训练与偏好优化 :LLM(title,title_cn);post-training(abstract);分类 cs.CL、cs.AI

AI总结 提出UnityMAS-O框架,将多智能体工作流作为优化单元,通过逻辑角色、图轨迹、用户定义奖励和智能体-模型映射四个核心对象解耦逻辑与物理参数,支持灵活的参数共享和奖励分配,在检索增强问答、迭代搜索和反思代码生成任务上验证了多智能体RL对手动工作流的提升效果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.23961 2026-05-26 q-bio.BM cs.AI cs.LG 89%

Multimodal Alignment and Preference Optimization for Zero-Shot Conditional RNA Generation

多模态对齐与偏好优化用于零样本条件RNA生成

Roman Klypa, Alberto Bietti, Sergei Grudinin

机构 * Univ. Grenoble Alpes, CNRS, Grenoble INP, LJK(格勒诺布尔阿尔卑斯大学、法国国家科学研究中心、格勒诺布尔INP、LJK实验室) Center for Computational Mathematics, Flatiron Institute(计算数学中心、Flatiron研究所)

专题命中 后训练与偏好优化 :preference optimization(title,abstract);SFT(abstract,abstract_cn);language model(abstract);pretraining(abstract)

AI总结 提出Moirain框架,通过多模态监督微调和直接偏好优化实现条件RNA序列生成,在零样本条件下生成具有高结合亲和力的生物合理RNA序列。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.07331 2026-05-11 cs.LG cs.AI 89%

Rethinking Importance Sampling in LLM Policy Optimization: A Cumulative Token Perspective

重新思考LLM策略优化中的重要性采样:从累积token视角

Yuheng Zhang, Chenlu Ye, Shuowei Jin, Changlong Yu, Wei Xiong, Saurabh Sahu, Nan Jiang

机构 * UIUC(伊利诺伊大学香槟分校) University of Michigan(密歇根大学) Amazon(亚马逊)

专题命中 后训练与偏好优化 :LLM(title,title_cn);post-training(abstract);分类 cs.AI、cs.LG

AI总结 本文提出CTPO,通过累积token重要性采样比解决偏倚-方差困境,结合位置自适应裁剪提升稳定性,实现更一致的正则化,在数学推理基准上表现最佳。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.06721 2026-05-08 cs.AI cs.CL cs.HC 89%

ProAgent: Harnessing On-Demand Sensory Contexts for Proactive LLM Agent Systems in the Wild

ProAgent:利用按需感官上下文实现野外的前瞻性LLM代理系统

Bufang Yang, Lilin Xu, Liekang Zeng, Yunqi Guo, Siyang Jiang, Wenrui Lu, Kaiwei Liu, Yixuan Li, Xiaofan Jiang, Guoliang Xing, Zhenyu Yan

机构 * The Chinese University of Hong Kong(香港中文大学) Columbia University(哥伦比亚大学)

专题命中 后训练与偏好优化 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 ProAgent通过整合低成本上下文线索与按需丰富感知,实现连续感知用户环境,利用上下文感知的前瞻性推理器推断用户需求,提升预测准确性与降低误检率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.17252 2026-03-10 cs.LG cs.AI 89%

Adaptive Batch-Wise Sample Scheduling for Direct Preference Optimization

适应性批级样本调度用于直接偏好优化

Zixuan Huang, Yikun Ban, Lean Fu, Xiaojie Li, Zhongxiang Dai, Jianxin Li, Deqing Wang

机构 * Beihang University(北京航空航天大学) Bytedance China(字节跳动中国) The Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳))

专题命中 后训练与偏好优化 :preference optimization(title,abstract);LLM(abstract);large language model(abstract);language model(abstract)

AI总结 本文提出SamS算法,通过动态调度训练样本提升DPO性能,无需修改核心算法,有效提高LLM对齐效果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.01293 2026-03-03 cs.LG cs.AI stat.ML 89%

Theoretical Perspectives on Data Quality and Synergistic Effects in Pre- and Post-Training Reasoning Models

数据质量和协同效应在预训练和后训练推理模型中的理论视角

Adel Javanmard, Baharan Mirzasoleiman, Vahab Mirrokni

专题命中 后训练与偏好优化 :post-training(title,abstract);large language model(abstract);language model(abstract);pretraining(abstract)

AI总结 本文通过理论分析揭示了预训练和后训练模型中数据质量与协同效应的关键机制,发现平衡预训练数据能激活潜在能力,SFT在挑战性小样本上表现最佳,而RL在大规模非困难数据上更有效。

Comments 35 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.10985 2026-03-03 cs.CL cs.AI 89%

When Data is the Algorithm: A Systematic Study and Curation of Preference Optimization Datasets

当数据成为算法:对偏好优化数据集的系统研究与整理

Aladin Djuhera, Farhan Ahmed, Swanand Ravindra Kadhe, Syed Zawad, Heiko Ludwig, Holger Boche

机构 * Technical University Munich(慕尼黑技术大学) IBM Research(IBM研究院)

专题命中 后训练与偏好优化 :preference optimization(title,abstract);LLM(abstract);large language model(abstract);language model(abstract)

AI总结 本文系统研究并整理了多个开源DPO数据集,提出UltraMix混合数据集,通过Magpie框架进行精细标注,揭示偏好质量差异,并在关键基准上超越最佳单个数据集性能。

Journal ref The Fourteenth International Conference on Learning Representations (ICLR) 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.13697 2026-02-05 cs.LG cs.AI 89%

RL in Name Only? Analyzing the Structural Assumptions in RL post-training for LLMs

仅名义上的强化学习?分析在LLM中post-training强化学习的结构假设

Soumya Rani Samineni, Durgesh Kalwar, Karthik Valmeekam, Kaya Stechly, Subbarao Kambhampati

机构 * SCAI, Arizona State University(SCAI,亚利桑那州立大学)

专题命中 后训练与偏好优化 :post-training(title,abstract);LLM(abstract);large language model(abstract);language model(abstract)

AI总结 本文分析了LLM post-training强化学习的结构假设,发现其退化为过滤迭代SFT,且激励生成更长的中间token序列。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.06682 2025-12-15 cs.CL cs.AI 89%

Textual Self-attention Network: Test-Time Preference Optimization through Textual Gradient-based Attention

文本自注意力网络:通过基于文本的梯度注意力进行测试时偏好优化

Shibing Mo, Haoyang Ruan, Kai Wu, Jing Liu

专题命中 后训练与偏好优化 :preference optimization(title,abstract);LLM(abstract);large language model(abstract);language model(abstract)

AI总结 本文提出TSAN,一种无需参数更新的测试时偏好优化方法,通过文本梯度空间实现多候选响应的系统分析与综合,提升输出质量。

Comments AAAI2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.05526 2025-12-10 cs.LG cs.AI 89%

Provably Mitigating Corruption, Overoptimization, and Verbosity Simultaneously in Offline and Online RLHF/DPO Alignment

可证明地同时缓解离线和在线RLHF/DPO对齐中的腐败、过度优化和冗余

Ziyi Chen, Junyi Li, Peiran Yu, Heng Huang

专题命中 后训练与偏好优化 :RLHF(title,abstract);LLM(abstract);large language model(abstract);language model(abstract)

AI总结 本文提出RLHF-COV和DPO-COV算法,同时缓解离线和在线RLHF/DPO对齐中的腐败、过度优化和冗余问题,并通过理论证明和实验验证其有效性。

Comments Edited a few incorrect numbers in Tables 2 and 3

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.00666 2025-09-29 cs.LG cs.AI stat.ML 89%

Avoiding $\mathbf{exp(R_{max})}$ scaling in RLHF through Preference-based Exploration

Mingyu Chen, Yiding Chen, Wen Sun, Xuezhou Zhang

机构 * Department of Electrical & Computer Engineering(电气与计算机工程系) Boston University(波士顿大学) Department of Computer Science(计算机科学系) Cornell University(康奈尔大学) Faculty of Computing & Data Sciences(计算与数据科学学院)

专题命中 后训练与偏好优化 :RLHF(title,abstract);LLM(abstract);large language model(abstract);language model(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.06026 2025-08-11 cs.CL cs.AI 89%

Temporal Self-Rewarding Language Models: Decoupling Chosen-Rejected via Past-Future

Yidong Wang, Xin Wang, Cunxiang Wang, Junfeng Fang, Qiufeng Wang, Jianing Chu, Xuran Meng, Shuxun Yang, Libo Qin, Yue Zhang, Wei Ye, Shikun Zhang

专题命中 后训练与偏好优化 :language model(title,abstract);LLM(abstract);large language model(abstract);preference optimization(abstract)

Comments 12 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.23247 2025-06-18 cs.LG cs.AI math.OC 89%

Accelerating RLHF Training with Reward Variance Increase

Zonglin Yang, Zhexuan Gu, Houduo Qi, Yancheng Yuan

机构 * The Hong Kong Polytechnic University(香港理工大学)

专题命中 后训练与偏好优化 :RLHF(title,abstract);LLM(abstract);large language model(abstract);language model(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.00577 2025-06-03 cs.AI cs.CL cs.GT cs.MA 89%

Reasoning Like an Economist: Post-Training on Economic Problems Induces Strategic Generalization in LLMs

Yufa Zhou, Shaobo Wang, Xingyu Dong, Xiangqi Jin, Yifang Chen, Yue Min, Kexin Yang, Xingzhang Ren, Dayiheng Liu, Linfeng Zhang

机构 * Duke University(杜克大学) EPIC Lab, Shanghai Jiao Tong University(上海交通大学EPIC实验室) Qwen Team, Alibaba Group(阿里集团Qwen团队) University of Pennsylvania(宾夕法尼亚大学) The University of Chicago(芝加哥大学)

专题命中 后训练与偏好优化 :post-training(title,abstract);LLM(abstract);large language model(abstract);language model(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2405.14953 2025-04-21 cs.LG cs.AI stat.ML 89%

MallowsPO: Fine-Tune Your LLM with Preference Dispersions

Haoxian Chen, Hanyang Zhao, Henry Lam, David Yao, Wenpin Tang

专题命中 后训练与偏好优化 :LLM(title,abstract);large language model(abstract);language model(abstract);RLHF(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2406.09760 2025-03-10 cs.CL cs.LG 89%

Bootstrapping Language Models with DPO Implicit Rewards

Changyu Chen, Zichen Liu, Chao Du, Tianyu Pang, Qian Liu, Arunesh Sinha, Pradeep Varakantham, Min Lin

专题命中 后训练与偏好优化 :language model(title,abstract);LLM(abstract);large language model(abstract);RLHF(abstract)

Comments Accepted in ICLR 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.13927 2025-01-24 cs.CL cs.AI cs.CV 89%

CRPO: Confidence-Reward Driven Preference Optimization for Machine Translation

Guofeng Cui, Pichao Wang, Yang Liu, Zemian Ke, Zhu Liu, Vimal Bhat

专题命中 后训练与偏好优化 :preference optimization(title,abstract);large language model(abstract);language model(abstract);pretraining(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.16974 2024-12-24 cs.AI cs.CL 89%

Cannot or Should Not? Automatic Analysis of Refusal Composition in IFT/RLHF Datasets and Refusal Behavior of Black-Box LLMs

Alexander von Recum, Christoph Schnabl, Gabor Hollbeck, Silas Alberti, Philip Blinde, Marvin von Hagen

专题命中 后训练与偏好优化 :RLHF(title,abstract);LLM(abstract);large language model(abstract);language model(abstract)

Comments NeurIPS 2024 Workshop SFLLM

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.14510 2024-12-20 cs.CL cs.AI 89%

PA-RAG: RAG Alignment via Multi-Perspective Preference Optimization

Jiayi Wu, Hengyi Cai, Lingyong Yan, Hao Sun, Xiang Li, Shuaiqiang Wang, Dawei Yin, Ming Gao

专题命中 后训练与偏好优化 :preference optimization(title,abstract);LLM(abstract);large language model(abstract);language model(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.06000 2024-12-10 cs.CL cs.LG 89%

Does RLHF Scale? Exploring the Impacts From Data, Model, and Method

Zhenyu Hou, Pengfan Du, Yilin Niu, Zhengxiao Du, Aohan Zeng, Xiao Liu, Minlie Huang, Hongning Wang, Jie Tang, Yuxiao Dong

专题命中 后训练与偏好优化 :RLHF(title,abstract);large language model(abstract);language model(abstract);pretraining(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2406.10858 2024-09-30 cs.CL cs.AI 89%

Step-level Value Preference Optimization for Mathematical Reasoning

Guoxin Chen, Minpeng Liao, Chengxi Li, Kai Fan

专题命中 后训练与偏好优化 :preference optimization(title,abstract);LLM(abstract);large language model(abstract);language model(abstract)

Comments Camera ready version for EMNLP2024-Findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2404.11999 2024-09-02 cs.CL cs.AI 89%

Token-level Direct Preference Optimization

Yongcheng Zeng, Guoqing Liu, Weiyu Ma, Ning Yang, Haifeng Zhang, Jun Wang

专题命中 后训练与偏好优化 :preference optimization(title,abstract);LLM(abstract);large language model(abstract);language model(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2402.09320 2024-02-15 cs.CL cs.AI 89%

ICDPO: Effectively Borrowing Alignment Capability of Others via In-context Direct Preference Optimization

Feifan Song, Yuxuan Fan, Xin Zhang, Peiyi Wang, Houfeng Wang

专题命中 后训练与偏好优化 :preference optimization(title,abstract);LLM(abstract);large language model(abstract);language model(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2402.08005 2024-02-14 cs.CL cs.LG 89%

Refined Direct Preference Optimization with Synthetic Data for Behavioral Alignment of LLMs

Víctor Gallego

专题命中 后训练与偏好优化 :preference optimization(title,abstract);LLM(abstract);large language model(abstract);language model(abstract)

Comments Pre-print. Submitted to the ICLR 2024 Workshop on Representational Alignment (Re-Align)

详情

展开后加载摘要…

URL PDF HTML 收藏
2311.14743 2024-01-25 cs.CL cs.LG 89%

A Baseline Analysis of Reward Models' Ability To Accurately Analyze Foundation Models Under Distribution Shift

Will LeVine, Benjamin Pikus, Anthony Chen, Sean Hendryx

专题命中 后训练与偏好优化 :foundation model(title,abstract);LLM(abstract);large language model(abstract);language model(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.13762 2025-12-17 cs.AI cs.HC 89%

State-Dependent Refusal and Learned Incapacity in RLHF-Aligned Language Models

基于状态依赖拒绝和学习无能的强化学习人类反馈对齐语言模型

TK Lee

专题命中 后训练与偏好优化 :language model(title,abstract);RLHF(title);large language model(abstract,comments);分类 cs.AI

AI总结 本研究提出通过观察行为来审计强化学习人类反馈对齐语言模型中的状态依赖拒绝和学习无能现象。

Comments 23 pages, 6 figures. Qualitative interaction-level analysis of response patterns in a large language model. Code and processed interaction data are available at https://github.com/theMaker-EnvData/llm_learned_incapacity_corpus

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.25760 2026-06-10 cs.CL cs.AI cs.LG 版本更新 89%

TruthRL: Incentivizing Truthful LLMs via Reinforcement Learning

TruthRL: 通过强化学习激励诚实的LLM

Zhepei Wei, Xiao Yang, Kai Sun, Jiaqi Wang, Rulin Shao, Jingxiang Chen, Mohammad Kachuee, Teja Gollapudi, Yiwei Liao, Nicolas Scheffer, Rakesh Wanga, Anuj Kumar, Yu Meng, Wen-tau Yih, Xin Luna Dong

机构 * University of California, Berkeley(加州大学伯克利分校)

专题命中 后训练与偏好优化 :LLM(title_cn,summary_cn);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 提出TruthRL框架,使用GRPO和三值奖励直接优化LLM的诚实性,减少幻觉并允许不确定时弃权,在知识密集型基准上显著提升诚实性。

Comments ICML 2026. Code: https://github.com/facebookresearch/TruthRL

详情

展开后加载摘要…

URL PDF HTML 收藏