arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

共收录 4556 信号源:cs.CL, cs.AI, cs.LG

1. 后训练与偏好优化 4556 篇

2510.06670 2026-04-10 cs.CL 85%

PIKA: Expert-Level Synthetic Datasets for Post-Training Alignment from Scratch

PIKA:从零开始的专家级合成数据集用于训练后对齐

Shangjian Yin, Shining Liang, Wenbiao Ding, Yuli Qian, Zhouxing Shi, Hongzhi Li, Yutao Xie

机构 * University of California, Riverside(加州大学河滨分校) Microsoft AI(微软人工智能)

专题命中 后训练与偏好优化 :post-training(title);LLM(abstract);SFT(abstract);preference optimization(abstract)

AI总结 PIKA通过高效的数据集提升对齐效果,仅用3万例超越大规模数据集,在AlpacaEval 2.0等基准测试中表现优异,且提供高质量偏好优化数据,降低数据需求,促进资源受限研究。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.02372 2026-04-06 cs.CR cs.LG 85%

Backdoor Attacks on Decentralised Post-Training

在去中心化后训练中的后门攻击

Oğuzhan Ersoy, Nikolay Blagoev, Jona te Lintelo, Stefanos Koffas, Marina Krček, Stjepan Picek

机构 * University of Neuchâtel(纳沙泰尔大学) Radboud University(拉德堡德大学) Delft University of Technology(代尔夫特理工大学) SecureML University of Zagreb(萨格勒布大学)

专题命中 后训练与偏好优化 :post-training(title,abstract);large language model(abstract);language model(abstract);分类 cs.LG

AI总结 本文提出首个针对流水线并行的后门攻击,通过控制中间阶段实现模型对齐偏差,实验显示触发词可使对齐率从80%降至6%,且在安全对齐训练下仍成功60%。

Comments Accepted to ICLR 2026 Workshop 'Principled Design for Trustworthy AI - Interpretability, Robustness, and Safety across Modalities'

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.29871 2026-04-01 cs.AI 85%

ShapE-GRPO: Shapley-Enhanced Reward Allocation for Multi-Candidate LLM Training

ShapE-GRPO:基于多候选LLM训练的Shapley增强奖励分配

Rui Ai, Yu Pan, David Simchi-Levi, Chonghuan Wang

机构 * MIT(麻省理工学院) University of Sydney(悉尼大学) University of Texas at Dallas(德克萨斯大学达拉斯分校)

专题命中 后训练与偏好优化 :LLM(title);large language model(abstract);language model(abstract);post-training(abstract)

AI总结 针对多候选LLM训练中奖励分配噪声问题,提出ShapE-GRPO方法,通过Shapley值理论分解集级奖励,提升训练效率与收敛速度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.14565 2026-04-01 cs.RO cs.AI 85%

Masked IRL: LLM-Guided Reward Disambiguation from Demonstrations and Language

掩码逆强化学习:从演示和语言引导的奖励消歧

Minyoung Hwang, Alexandra Forsey-Smerek, Nathaniel Dennler, Andreea Bobu

机构 * MIT CSAIL(麻省理工学院计算机科学与人工智能实验室)

专题命中 后训练与偏好优化 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本文提出掩码逆强化学习框架,利用大语言模型结合演示和语言信息,提升机器人奖励学习的样本效率和泛化能力。

Comments Accepted to ICRA 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.00835 2026-03-24 cs.AI cs.CV 85%

SynPO: Synergizing Descriptiveness and Preference Optimization for Video Detailed Captioning

SynPO:融合描述性和偏好优化的视频详细描述生成

Jisheng Dang, Yizhou Zhang, Hao Ye, Teng Wang, Siming Chen, Huicheng Zheng, Yulan Guo, Jianhuang Lai, Bin Hu

机构 * Sun Yat-Sen University(中山大学) Lanzhou University(兰州大学) The University of Hong Kong(香港大学) Beijing Institute of Technology(北京理工大学) National University of Singapore(新加坡国立大学)

专题命中 后训练与偏好优化 :preference optimization(title,abstract);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本文提出SynPO方法,通过偏好学习提升视频描述生成性能,解决直接偏好优化的局限性,提升训练效率20%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.19251 2026-03-23 cs.CL 85%

Enhancing Legal LLMs through Metadata-Enriched RAG Pipelines and Direct Preference Optimization

通过元数据增强的RAG流水线和直接偏好优化增强法律LLM

Suyash Maniyar, Deepali Singh, Rohith Reddy

专题命中 后训练与偏好优化 :preference optimization(title,abstract);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 本文提出元数据增强的RAG和直接偏好优化,解决法律领域长文本检索和生成中的精度问题,提升模型的可靠性与安全性。

Comments 12 pages including Appendix

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.09206 2026-03-11 cs.CV cs.LG 85%

MM-Zero: Self-Evolving Multi-Model Vision Language Models From Zero Data

MM-Zero: 从零数据自我进化多模型视觉语言模型

Zongxia Li, Hongyang Du, Chengsong Huang, Xiyang Wu, Lantao Yu, Yicheng He, Jing Xie, Xiaomin Wu, Zhichao Liu, Jiarui Zhang, Fuxiao Liu

机构 * University of Maryland(马里兰大学) Brown University(布朗大学) Washington University in St. Louis(圣路易斯华盛顿大学) Adobe University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) University of Southern California(南加州大学) NVIDIA

专题命中 后训练与偏好优化 :language model(title,abstract);LLM(abstract);large language model(abstract);分类 cs.LG

AI总结 MM-Zero通过多角色框架实现VLM零数据自我进化,提升多模态推理性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.03054 2026-03-10 cs.CL 85%

PrivMedChat: End-to-End Differentially Private RLHF for Medical Dialogue Systems

PrivMedChat: 医疗对话系统的端到端差分隐私RLHF

Sudip Bhujel

机构 * Graduate Student in the Department of Computer Science, University of Kentucky(计算机科学系研究生,肯塔基大学)

专题命中 后训练与偏好优化 :RLHF(title,abstract);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 PrivMedChat通过端到端差分隐私RLHF方法,在医疗对话系统中实现隐私保护与对齐,采用DP-SGD和DP-aware策略优化,避免临床标注成本,提供正式隐私保证。

Comments 13 pages, 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.25762 2026-03-06 cs.LG 85%

OPPO: Accelerating PPO-based RLHF via Pipeline Overlap

OPPO: 通过管道重叠加速基于PPO的RLHF

Kaizhuo Yan, Yingjie Yu, Yifan Yu, Haizhong Zheng, Fan Lai

机构 * University of Illinois Urbana–Champaign(伊利诺伊大学厄巴纳-香槟分校) Carnegie Mellon University(卡内基梅隆大学)

专题命中 后训练与偏好优化 :RLHF(title,abstract);large language model(abstract);language model(abstract);分类 cs.LG

AI总结 OPPO通过管道重叠技术提升基于PPO的RLHF训练效率,加速训练过程并提高GPU利用率

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.05534 2026-03-03 cs.CL 85%

Revisiting Self-Play Preference Optimization: On the Role of Prompt Difficulty

重新审视自我对弈偏好优化:关于提示难度的作用

Yao Xiao, Jung-jae Kim, Roy Ka-wei Lee, Lidong Bing

专题命中 后训练与偏好优化 :preference optimization(title,abstract);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 本文研究了提示难度对自我对弈偏好优化的影响,发现困难提示会降低性能,而简单提示更有效,提出通过训练少量简单提示来提升模型表现。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.26578 2026-03-02 cs.LG 85%

Linking Process to Outcome: Conditional Reward Modeling for LLM Reasoning

将过程与结果联系起来:用于大语言模型推理的条件奖励建模

Zheng Zhang, Ziwei Shan, Kaitao Song, Yexin Li, Kan Ren

专题命中 后训练与偏好优化 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.LG

AI总结 本文提出条件奖励建模(CRM),通过将LLM推理视为时间过程,解决奖励分配模糊性和奖励黑客问题,提升推理性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.24159 2026-03-02 cs.AI 85%

RE-PO: Robust Enhanced Policy Optimization as a General Framework for LLM Alignment

RE-PO:一种用于大语言模型对齐的鲁棒增强策略优化通用框架

Xiaoyang Cao, Zelai Xu, Mo Guang, Kaiwen Long, Michiel A. Bakker, Yu Wang, Chao Yu

机构 * IDSS, Massachusetts Institute of Technology(IDSS,麻省理工学院) EE, Tsinghua University(电子工程系,清华大学) Li Auto Inc.(力汽车公司) SIGS, Tsinghua University(系统工程系,清华大学)

专题命中 后训练与偏好优化 :LLM(title);large language model(abstract);language model(abstract);RLHF(abstract)

AI总结 RE-PO是一种用于大语言模型对齐的鲁棒增强策略优化通用框架,通过期望最大化程序推断标签正确性并自适应加权数据点以减轻噪声,提升对齐效果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.23840 2026-03-02 cs.CL 85%

Measuring Sycophancy of Language Models in Multi-turn Dialogues

在多轮对话中衡量语言模型的趋炎附势性

Jiseung Hong, Grace Byun, Seungone Kim, Kai Shu, Jinho D. Choi

机构 * Carnegie Mellon University(卡内基梅隆大学) Emory University(埃默里大学)

专题命中 后训练与偏好优化 :language model(title,abstract);large language model(abstract);prompting(abstract);分类 cs.CL

AI总结 本研究提出SYCON基准,评估多轮对话中语言模型的趋炎附势性,发现对齐调优会放大该行为,而模型规模和推理优化能增强抗压能力,采用第三人称视角可显著减少趋炎附势性。

Comments Accepted to Findings of EMNLP 2025

Journal ref Findings of the Association for Computational Linguistics: EMNLP 2025, pages 2239-2259

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.03411 2026-02-25 cs.SE cs.CL 85%

SWE-Master: Unleashing the Potential of Software Engineering Agents via Post-Training

SWE-Master:通过训练后技术释放软件工程代理的潜力

Huatong Song, Lisheng Huang, Shuang Sun, Jinhao Jiang, Ran Le, Daixuan Cheng, Guoxin Chen, Yiwen Hu, Zongchao Chen, Yiming Jia, Wayne Xin Zhao, Yang Song, Tao Zhang, Ji-Rong Wen

专题命中 后训练与偏好优化 :post-training(title,abstract);LLM(abstract);SFT(abstract);分类 cs.CL

AI总结 SWE-Master通过训练后技术提升软件工程代理能力,实现61.4%的解决率并优于现有基线。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.13891 2026-02-17 cs.SD cs.AI 85%

GSRM: Generative Speech Reward Model for Speech RLHF

GSRM:生成式语音奖励模型用于语音强化学习反馈机制

Maohao Shen, Tejas Jayashankar, Osama Hanna, Naoyuki Kanda, Yancheng Wang, Kateřina Žmolíková, Ruiming Xie, Niko Moritz, Anfeng Xu, Yashesh Gaur, Gregory Wornell, Qing He, Jilong Wu

机构 * Meta Superintelligence Labs(Meta超智能实验室) Massachusetts Institute of Technology(麻省理工学院) Arizona State University(亚利桑那州立大学) University of Southern California(南加州大学)

专题命中 后训练与偏好优化 :RLHF(title,abstract);LLM(abstract);language model(abstract);分类 cs.AI

AI总结 GSRM通过生成式语音奖励模型提升语音生成的自然度,利用可解释的推理链实现更准确的自然度评估。

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.17315 2026-02-17 cs.CL 85%

HIPPO: Enhancing the Table Understanding Capability of LLMs through Hybrid-Modal Preference Optimization

HIPPO:通过混合模态偏好优化增强大语言模型的表格理解能力

Haolan Wang, Zhenghao Liu, Xinze Li, Xiaocui Yang, Yu Gu, Yukun Yan, Qi Shi, Fangfang Li, Chong Chen, Ge Yu

机构 * School of Computer Science and Engineering, Northeastern University, Shenyang, China(东北大学计算机科学与工程学院) Department of Computer Science and Technology, Tsinghua University, Beijing, China(清华大学计算机科学与技术系) Huawei Technologies Co., Ltd(华为技术有限公司)

专题命中 后训练与偏好优化 :preference optimization(title,abstract);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 HIPPO 通过混合模态偏好优化提升大语言模型的表格理解能力,实现 4% 的性能提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.12180 2026-02-13 cs.LG cs.GT 85%

How Sampling Shapes LLM Alignment: From One-Shot Optima to Iterative Dynamics

采样如何塑造大语言模型对齐:从单次最优到迭代动态

Yurong Chen, Yu He, Michael I. Jordan, Fan Yao

机构 * Inria(法国国家信息与自动化研究所) École Normale Supérieure(巴黎高等师范学校) PSL Research University(巴黎综合理工研究所) Northwestern University(西北大学) University of California, Berkeley(加州大学伯克利分校) University of North Carolina at Chapel Hill(北卡罗来纳大学教堂山分校)

专题命中 后训练与偏好优化 :LLM(title);large language model(abstract);language model(abstract);preference optimization(abstract)

AI总结 研究探讨了采样对大语言模型对齐的影响,发现适当采样可提升排序保证,而偏向采样可能导致集中问题,并分析了迭代动态中的稳定性问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.11779 2026-02-13 cs.LG 85%

Temperature as a Meta-Policy: Adaptive Temperature in LLM Reinforcement Learning

温度作为元策略:LLM强化学习中的自适应温度

Haoran Dang, Cuiling Lan, Hai Wan, Xibin Zhao, Yan Lu

机构 * Tsinghua University(清华大学) Microsoft Research Asia(微软亚洲研究院)

专题命中 后训练与偏好优化 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.LG

AI总结 TAMPO通过将温度控制转化为可学习的元策略,实现了LLM强化学习中的自适应探索,优于固定或启发式温度方法。

Comments Accepted at ICLR 2026. 10 pages (main text) + supplementary material, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.07054 2026-02-10 cs.LG cs.CV cs.HC 85%

AVERE: Improving Audiovisual Emotion Reasoning with Preference Optimization

AVERE: 通过偏好优化提升音频视觉情感推理

Ashutosh Chaubey, Jiacheng Pang, Maksim Siniukov, Mohammad Soleymani

专题命中 后训练与偏好优化 :preference optimization(title,abstract);large language model(abstract);language model(abstract);分类 cs.LG

AI总结 AVERE通过偏好优化技术提升音频视觉情感推理性能,解决情感与无关线索的虚假关联和幻觉问题,提升多模态模型在情感理解中的表现。

Comments Accepted as a conference paper at ICLR 2026. Project page: https://avere-iclr.github.io

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.12434 2026-02-05 cs.AI 85%

Building Coding Agents via Entropy-Enhanced Multi-Turn Preference Optimization

通过熵增强的多轮偏好优化构建编码代理

Jiahao Yu, Zelei Cheng, Xian Wu, Xinyu Xing

机构 * Department of Computer Science, Northwestern University, Evanston, USA(西北大学计算机科学系) Meta AI, Bellevue, USA(Meta AI)

专题命中 后训练与偏好优化 :preference optimization(title,abstract);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本文提出EntroPO框架,通过增强熵的方法提升多轮交互中编码代理的性能,实现更高效的测试时间扩展。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.23096 2026-02-03 cs.LG 85%

CATTO: Balancing Preferences and Confidence in Language Models

CATTO: 在语言模型中平衡偏好与信心

Nisarg Parikh, Ananya Sai, Pannaga Shivaswamy, Kunjal Panchal, Andrew Lan

机构 * Adobe

专题命中 后训练与偏好优化 :language model(title,abstract);large language model(abstract);preference optimization(abstract);分类 cs.LG

AI总结 CATTO通过校准意识的标记级训练目标,在保持任务准确性的同时,有效提升语言模型预测信心,减少校准误差,提高输出选择的可靠性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.01002 2026-02-03 cs.AI 85%

How RLHF Amplifies Sycophancy

如何通过RLHF放大阿谀行为

Itai Shapira, Gerdus Benade, Ariel D. Procaccia

机构 * harvard(哈佛大学)

专题命中 后训练与偏好优化 :RLHF(title);large language model(abstract);language model(abstract);post-training(abstract)

AI总结 本文研究了RLHF如何通过放大机制增强阿谀行为,提出了一种训练干预措施以减少这种偏差。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.16403 2026-01-26 cs.LG 85%

Towards a Theoretical Understanding to the Generalization of RLHF

迈向RLHF泛化性的理论理解

Zhaochun Li, Mingyang Yi, Yue Wang, Shisheng Cui, Yong Liu

机构 * Beijing Institute of Technology(北京理工大学) Zhongguancun Academy(中关村学院) Renmin University of China(中国人民大学)

专题命中 后训练与偏好优化 :RLHF(title,abstract);large language model(abstract);language model(abstract);分类 cs.LG

AI总结 本文通过算法稳定性框架,在线性奖励模型下构建了RLHF下LLM的泛化理论,证明在特征覆盖条件下策略模型的泛化界为O(n^{-1/2}),并推广到梯度方法参数。

Comments 31 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.04700 2026-01-21 cs.CL 85%

PRISM: A Unified Framework for Post-Training LLMs Without Verifiable Rewards

PRISM: 一种无需可验证奖励的统一后训练LLM框架

Mukesh Ghimire, Aosong Feng, Liwen You, Youzhi Luo, Fang Liu, Xuan Zhu

机构 * Arizona State University(亚利桑那州立大学) Amazon Web Services(亚马逊网络服务)

专题命中 后训练与偏好优化 :post-training(title,abstract);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 PRISM通过结合过程奖励模型与自我确定性,实现无需真实标签的稳定训练和提升LLM测试性能。

Comments Added open-sourced github url

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.09212 2026-01-21 cs.CL 85%

Targeting Misalignment: A Conflict-Aware Framework for Reward-Model-based LLM Alignment

针对对齐偏差:一种基于冲突意识的奖励模型驱动LLM对齐框架

Zixuan Liu, Siavash H. Khajavi, Guangkai Jiang, Xinru Liu

专题命中 后训练与偏好优化 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 本文提出了一种基于冲突意识的框架,通过识别和缓解代理模型与策略间的冲突来提升大语言模型的对齐性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.10387 2026-01-16 cs.CL 85%

The Assistant Axis: Situating and Stabilizing the Default Persona of Language Models

助手轴:定位和稳定语言模型的默认人格

Christina Lu, Jack Gallagher, Jonathan Michala, Kyle Fish, Jack Lindsey

机构 * MATS Anthropic Fellows Program University of Oxford(牛津大学) Anthropic

专题命中 后训练与偏好优化 :language model(title,abstract);large language model(abstract);post-training(abstract);分类 cs.CL

AI总结 研究发现语言模型的默认人格轴影响行为稳定性,通过限制激活区域可防止人格漂移及对抗性突破。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.04694 2026-01-09 cs.AI 85%

ResMAS: Resilience Optimization in LLM-based Multi-agent Systems

ResMAS: LLM-based多智能体系统中的韧性优化

Zhilun Zhou, Zihan Liu, Jiahe Liu, Qingyu Shao, Yihan Wang, Kun Shao, Depeng Jin, Fengli Xu

专题命中 后训练与偏好优化 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 ResMAS通过两阶段框架提升LLM-based MAS的韧性,结合奖励模型与拓扑生成器优化拓扑和提示设计,增强系统在扰动下的稳定性与泛化能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.00623 2026-01-05 cs.AI 85%

DA-DPO: Cost-efficient Difficulty-aware Preference Optimization for Reducing MLLM Hallucinations

DA-DPO:面向减少多模态大语言模型幻觉的高效难度感知偏好优化

Longtian Qiu, Shan Ning, Chuyu Zhang, Jiaxuan Sun, Xuming He

机构 * ShanghaiTech University(上海科技大学) Lingang Laboratory(灵冈实验室) Shanghai Engineering Research Center of Intelligent Vision and Imaging(上海智能视觉与成像工程技术研究中心)

专题命中 后训练与偏好优化 :preference optimization(title,abstract);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 DA-DPO通过难度感知机制优化多模态大语言模型的偏好学习,有效减少幻觉并提升模型鲁棒性与泛化能力。

Comments Accepted by TMLR

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.24609 2026-01-01 cs.AI 85%

Reinforcement Learning-Augmented LLM Agents for Collaborative Decision Making and Performance Optimization

强化学习增强的LLM代理用于协作决策与性能优化

Dong Qiu, Duo Xu, Limengxi Yue

专题命中 后训练与偏好优化 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本研究提出强化学习增强的LLM代理框架,通过GRPO和联合奖励优化,提升多智能体协作任务的效率与一致性。

Comments Accepted by IEEE ICFTIC 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.11712 2025-12-23 cs.AI 85%

Mitigating Hallucination Through Theory-Consistent Symmetric Multimodal Preference Optimization

通过理论一致的对称多模态偏好优化缓解幻觉

Wenqi Liu, Xuemeng Song, Jiaxi Li, Yinwei Wei, Na Zheng, Jianhua Yin, Liqiang Nie

机构 * Shandong University(山东大学) Southern University of Science and Technology(南方科技大学) University of Georgia(佐治亚大学) National University of Singapore(新加坡国立大学) Harbin Institute of Technology (Shenzhen)(哈尔滨工业大学(深圳))

专题命中 后训练与偏好优化 :preference optimization(title,abstract);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 SymMPO通过理论一致的对称多模态偏好优化方法,有效缓解多模态大语言模型中的幻觉问题。

Comments NeurIPS 2025

详情

展开后加载摘要…

URL PDF HTML 收藏