arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

共收录 4556 信号源:cs.CL, cs.AI, cs.LG

1. 后训练与偏好优化 4556 篇

2605.09359 2026-05-12 cs.LG cs.AI 82%

Skill-R1: Agent Skill Evolution via Reinforcement Learning

Skill-R1:通过强化学习实现智能体技能进化

Yash Vishe, Rohan Surana, Xunyi Jiang, Zihan Huang, Xintong Li, Nikki Lijing Kuang, Tong Yu, Ryan A. Rossi, Jingbo Shang, Julian McAuley, Junda Wu

机构 * UC San Diego(UC圣地亚哥大学) Adobe Research(Adobe研究院)

专题命中 后训练与偏好优化 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 Skill-R1通过强化学习框架实现实例级递归技能优化,利用可验证奖励训练轻量级技能生成器,提升智能体在复杂多步骤任务中的表现。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.17698 2026-04-30 cs.LG cs.CL stat.ML 82%

The Geometric Canary: Predicting Steerability and Detecting Drift via Representational Stability

几何渡鸦:通过表征稳定性预测可操控性并检测漂移

Prashant C. Raju

机构 * Prashant C. Raju

专题命中 后训练与偏好优化 :LLM(abstract,abstract_cn);language model(abstract);post-training(abstract);分类 cs.CL、cs.LG

AI总结 本文提出通过表征稳定性预测语言模型的可操控性并检测漂移,展示了监督和非监督稳定性在不同任务中的互补作用。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.20904 2026-04-24 cs.LG cs.AI 82%

Reinforcing privacy reasoning in LLMs via normative simulacra from fiction

通过小说中的规范仿像强化大语言模型的隐私推理

Matt Franchi, Madiha Zahrah Choksi, Harold Triedman, Helen Nissenbaum

机构 * Cornell Tech(康奈尔科技)

专题命中 后训练与偏好优化 :LLM(abstract,abstract_cn);SFT(abstract,abstract_cn);分类 cs.AI、cs.LG

AI总结 本文通过从小说中提取规范仿像,结合监督学习和GRPO强化学习,提升大语言模型的隐私推理能力,验证了小说来源的规范仿像在现实领域中的有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.18547 2026-04-21 stat.ML cs.CL cs.LG 82%

FUSE: Ensembling Verifiers with Zero Labeled Data

FUSE:无需标注数据的验证器集成

Joonhyuk Lee, Virginia Ma, Sarah Zhao, Yash Nair, Asher Spector, Regev Cohen, Emmanuel J. Candès

机构 * Stanford University(斯坦福大学) Google(谷歌)

专题命中 后训练与偏好优化 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);分类 cs.CL、cs.LG

AI总结 FUSE通过无监督集成验证器提升大语言模型输出验证质量,无需标注数据,在多种生成模型和基准测试中表现优异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.24235 2026-04-21 cs.LG cs.AI 82%

PaTaRM: Bridging Pairwise and Pointwise Signals via Preference-Aware Task-Adaptive Reward Modeling

PaTaRM:通过偏好感知任务自适应奖励模型弥合成对和点状信号

Ai Jian, Jingqing Ruan, Xing Ma, Xiaoyun Zhang, Dailin Li, Weipeng Zhang, Ke Zeng, Xunliang Cai

机构 * Beijing University of Posts and Telecommunications(北京邮电大学) Meituan(美团) University of Chinese Academy of Sciences(中国科学院大学)

专题命中 后训练与偏好优化 :RLHF(abstract,abstract_cn);large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 PaTaRM通过偏好感知奖励机制实现成对和点状信号的弥合,无需显式评分标签,提升奖励模型的鲁棒性和任务适应性,实验显示在多个基准测试中表现优异。

Comments ACL Main

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.07506 2026-04-21 cs.AI cs.CL 82%

ReflectRM: Boosting Generative Reward Models via Self-Reflection within a Unified Judgment Framework

ReflectRM: 通过统一判断框架内的自我反思提升生成奖励模型

Kai Qin, Liangxin Liu, Yu Liang, Longzheng Wang, Yan Wang, Yueyang Zhang, Long Xia, Zhiyuan Sun, Houde Liu, Daiting Shi

机构 * Shenzhen International Graduate School, Tsinghua University(清华大学深圳国际研究生院) Baidu Inc.(百度公司)

专题命中 后训练与偏好优化 :RLHF(abstract,abstract_cn);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 ReflectRM通过自我反思评估分析质量,提升偏好建模,实验表明其在四个基准测试中平均准确率提升3.7%,并有效缓解位置偏差。

Comments Preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.14389 2026-04-21 cs.LG cs.AI 82%

From $\log π$ to $π$: Taming Divergence in Soft Clipping via Bilateral Decoupled Decay of Probability Gradient Weight

从log π到π:通过双侧解耦衰减概率梯度权重来驯服发散

Xiaoliang Fu, Jiaye Lin, Yangyi Fang, Chaowen Hu, Cong Qin, Zekai Shao, Binbin Zheng, Lu Pan, Ke Zeng

机构 * Meituan(美团) Fudan University(复旦大学) Tsinghua University(清华大学) Peking University(北京大学) University of Science and Technology of China(中国科学技术大学)

专题命中 后训练与偏好优化 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 本文提出DGPO方法,通过解耦衰减机制解决RLVR中概率梯度发散问题,提升大语言模型的推理能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.02766 2026-04-06 cs.LG cs.AI 82%

Random Is Hard to Beat: Active Selection in online DPO with Modern LLMs

随机难以超越:在线DPO中的主动选择

Giyeong Oh, Junghyun Lee, Jaehyun Park, Youngjae Yu, Wonho Bae, Junhyug Noh

机构 * Seoul National University(首尔大学) Ewha Womans University(梨花女子大学) KAIST(韩国科学技术院) UBC(不列颠哥伦比亚大学)

专题命中 后训练与偏好优化 :LLM(abstract);pretraining(abstract);post-training(abstract);preference optimization(abstract)

AI总结 本文研究了在线DPO中主动选择策略的有效性,发现即使在强先验基础上,主动选择的计算开销难以抵消简单随机采样带来的多样性优势。

Comments first commit

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.00234 2026-04-02 cs.CL cs.AI 82%

OmniFusion: Simultaneous Multilingual Multimodal Translations via Modular Fusion

OmniFusion: 通过模块融合实现多语言多模态翻译

Sai Koneru, Matthias Huck, Jan Niehues

机构 * Karlsruhe Institute of Technology(卡尔斯鲁厄理工学院) SAP SE(SAP公司)

专题命中 后训练与偏好优化 :LLM(abstract);large language model(abstract);language model(abstract);foundation model(abstract)

AI总结 本文提出OmniFusion系统,通过融合预训练多模态基础模型与翻译LLM,实现语音、语音加图像及文本加图像的多语言多模态翻译,降低SimulST延迟并提升翻译质量。

Comments Revised submission in review for ACL ARR

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.15647 2026-03-18 cs.LG cs.AI 82%

Steering Frozen LLMs: Adaptive Social Alignment via Online Prompt Routing

引导冻结的大型语言模型:通过在线提示路由实现适应性社会对齐

Zeyu Zhang, Xiangxiang Dai, Ziyi Han, Xutong Liu, John C. S. Lui

机构 * The Chinese University of Hong Kong(香港中文大学) University of Washington(华盛顿大学)

专题命中 后训练与偏好优化 :large language model(abstract);language model(abstract);post-training(abstract);RLHF(abstract)

AI总结 本文提出CCLUB框架,通过系统提示路由实现适应性社会对齐,解决部署时静态策略无法应对动态安全规范的问题,实验显示其在累积奖励和子最优差距上优于基线方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.17721 2026-03-09 cs.LG cs.AI cs.MA 82%

Aligning Compound AI Systems via System-level DPO

通过系统级DPO对复合AI系统进行对齐

Xiangwen Wang, Yibo Jacky Zhang, Zhoujie Ding, Katherine Tsai, Haolun Wu, Sanmi Koyejo

机构 * Stanford University(斯坦福大学) University of Illinois Urbana Champaign(伊利诺伊大学厄巴纳-香槟分校) Mila Quebec AI Institute(魁北克AI研究院)

专题命中 后训练与偏好优化 :LLM(abstract);language model(abstract);foundation model(abstract);preference optimization(abstract)

AI总结 本文提出SysDPO框架,通过系统级DPO实现复合AI系统的联合对齐,解决了组件间非可微分交互和系统偏好转换的问题。

Comments NeurIPS 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.04968 2026-03-06 cs.CL cs.AI 82%

When Weak LLMs Speak with Confidence, Preference Alignment Gets Stronger

当弱大语言模型自信发言时,偏好对齐会变得更强大

Amirabbas Afzali, Myeongho Jeon, Maria Brbic

机构 * EPFL(苏黎世联邦理工学院) Sharif University of Technology(谢赫·穆吉加布大学)

专题命中 后训练与偏好优化 :LLM(abstract);large language model(abstract);language model(abstract);preference optimization(abstract)

AI总结 本文提出CW-PO框架,利用弱LLM的置信度加权实现更高效的偏好对齐,仅用20%的人类标注即可超越传统方法。

Comments 32 pages, 8 figures, International Conference on Learning Representations 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.03112 2026-03-05 cs.CL cs.AI cs.CY 82%

RLVER: Reinforcement Learning with Verifiable Emotion Rewards for Empathetic Agents

RLVER: 通过可验证情绪奖励的强化学习实现共情代理

Peisong Wang, Ruotian Ma, Bang Zhang, Xingyu Chen, Zhiwei He, Kang Luo, Qingsong Lv, Qingxuan Jiang, Zheng Xie, Shanyi Wang, Yuan Li, Fanghua Ye, Jian Li, Yifan Yang, Zhaopeng Tu, Xiaolong Li

机构 * Tencent(腾讯)

专题命中 后训练与偏好优化 :LLM(abstract);large language model(abstract);language model(abstract);language agent(abstract)

AI总结 RLVER通过可验证情绪奖励提升LLM的共情能力,实验显示其在对话任务中显著提升表现,尤其在情感理解和洞察力方面成效显著。

Comments Code: https://github.com/Tencent/DigitalHuman/tree/main/RLVER

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.15222 2026-02-18 cs.LG cs.AI 82%

Automatically Finding Reward Model Biases

自动发现奖励模型偏差

Atticus Wang, Iván Arcuschin, Arthur Conmy

机构 * Massachusetts Institute of Technology(麻省理工学院)

专题命中 后训练与偏好优化 :LLM(abstract);large language model(abstract);language model(abstract);post-training(abstract)

AI总结 本文提出了一种利用LLM自动发现奖励模型偏差的方法,揭示了已知和新型偏差,并展示了进化迭代优于传统搜索方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.01952 2026-02-10 cs.CV cs.AI cs.LG cs.RO 82%

GrndCtrl: Grounding World Models via Self-Supervised Reward Alignment

GrndCtrl: 通过自监督奖励对齐实现世界模型的 grounding

Haoyang He, Jay Patrikar, Dong-Ki Kim, Max Smith, Daniel McGann, Ali-akbar Agha-mohammadi, Shayegan Omidshafiei, Sebastian Scherer

专题命中 后训练与偏好优化 :large language model(abstract);language model(abstract);pretraining(abstract);post-training(abstract)

AI总结 GrndCtrl通过自监督奖励对齐提升世界模型的几何 grounding,实现更稳定的空间一致性与导航性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.06665 2026-02-09 cs.CL cs.AI 82%

Not All Layers Need Tuning: Selective Layer Restoration Recovers Diversity

并非所有层都需要调节:选择性层恢复恢复多样性

Bowen Zhang, Meiyi Wang, Harold Soh

机构 * Department of Computer Science, National University of Singapore, Singapore(新加坡国立大学计算机科学系) Smart Systems Institute, National University of Singapore, Singapore, Singapore(新加坡国立大学智能系统研究所)

专题命中 后训练与偏好优化 :LLM(abstract);large language model(abstract);language model(abstract);post-training(abstract)

AI总结 选择性层恢复通过恢复特定层到预训练权重,提升LLM输出多样性并保持高质量。

Comments 16 pages, 7 figures, 12 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.13579 2026-02-06 cs.LG cs.AI 82%

Learning to summarize user information for personalized reinforcement learning from human feedback

学习总结用户信息以实现基于人类反馈的个性化强化学习

Hyunji Nam, Yanming Wan, Mickel Liu, Peter Ahnn, Jianxun Lian, Natasha Jaques

机构 * Stanford University(斯坦福大学) University of Washington(华盛顿大学) DoorDash Microsoft Research Asia(微软亚洲研究院)

专题命中 后训练与偏好优化 :LLM(abstract);large language model(abstract);language model(abstract);RLHF(abstract)

AI总结 PLUS通过学习用户信息摘要实现个性化强化学习,提升奖励模型准确性并实现零样本个性化。

Comments 10 pages for main text, 10 pages for appendix

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.20106 2026-02-05 cs.LG cs.AI 82%

Adaptive Helpfulness-Harmlessness Alignment with Preference Vectors

基于偏好向量的自适应有益有害对齐

Ren-Wei Liang, Chin-Ting Hsu, Chan-Hung Yu, Saransh Agrawal, Shih-Cheng Huang, Chieh-Yen Lin, Shang-Tse Chen, Kuan-Hao Huang, Shao-Hua Sun

机构 * National Taiwan University(国立台湾大学) Texas A&M University(德克萨斯A&M大学) Appier AI Research(Appier人工智能研究院) Graduate Institute of Communication Engineering, National Taiwan University(国立台湾大学通信工程研究所)

专题命中 后训练与偏好优化 :large language model(abstract);language model(abstract);RLHF(abstract);preference optimization(abstract)

AI总结 本文提出偏好向量框架,通过模块化方法实现细粒度的用户可控偏好调整,提升大语言模型的有益性和无害性平衡。

Comments Accepted at The 19th Conference of the European Chapter of the Association for Computational Linguistics (EACL 2026), Rabat, Morocco

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.00665 2026-02-02 cs.CL cs.AI 82%

SAFER: Probing Safety in Reward Models with Sparse Autoencoder

SAFER: 通过稀疏自动编码器探索奖励模型的安全性

Wei Shi, Ziyuan Xie, Sihang Li, Xiang Wang

机构 * University of Science and Technology of China(中国科学技术大学)

专题命中 后训练与偏好优化 :LLM(abstract);large language model(abstract);language model(abstract);RLHF(abstract)

AI总结 SAFER通过稀疏自动编码器探索奖励模型的安全性,揭示可解释特征并改进安全性对齐。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.22718 2026-02-02 cs.AI cs.LG 82%

A Step Back: Prefix Importance Ratio Stabilizes Policy Optimization

后退一步:前缀重要性比率稳定了策略优化

Shiye Lei, Zhihao Cheng, Dacheng Tao

机构 * The University of Sydney(悉尼大学) ByteDance(字节跳动) Nanyang Technological University(南洋理工大学)

专题命中 后训练与偏好优化 :LLM(abstract);large language model(abstract);language model(abstract);post-training(abstract)

AI总结 本文提出MinPRO目标,通过使用非累积的最小token级比率替代累积前缀比率,以稳定LLM在非策略性条件下的训练和优化。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.17579 2025-11-25 cs.LG cs.AI 82%

Multi-Value Alignment for LLMs via Value Decorrelation and Extrapolation

通过价值去相关与外推实现大语言模型的多值对齐

Hefei Xu, Le Wu, Chen Cheng, Hao Liu

专题命中 后训练与偏好优化 :large language model(abstract);language model(abstract);RLHF(abstract);preference optimization(abstract)

AI总结 本文提出多值对齐框架MVA,通过价值去相关与外推策略,有效解决多价值观对齐中的稳定性与冲突处理问题,实验表明其在多值对齐任务中表现优于现有方法。

Comments accepted by AAAI26 oral; 12 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.07896 2025-11-12 cs.AI cs.CL 82%

SparseRM: A Lightweight Preference Modeling with Sparse Autoencoder

Dengcan Liu, Jiahao Li, Zheren Fu, Yi Tu, Jiajun Li, Zhendong Mao, Yongdong Zhang

专题命中 后训练与偏好优化 :LLM(abstract);large language model(abstract);language model(abstract);post-training(abstract)

Comments 15pages,11figures,AAAI-26

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.18312 2025-11-10 cs.LG cs.AI 82%

What Matters in Data for DPO?

Yu Pan, Zhongze Cai, Guanting Chen, Huaiyang Zhong, Chonghuan Wang

机构 * University of Sydney(悉尼大学) Imperial College London(伦敦帝国理工学院) University of North Carolina at Chapel Hill(北卡罗来纳大学教堂山分校) Virginia Tech(弗吉尼亚理工大学) University of Texas at Dallas(德克萨斯大学达拉斯分校)

专题命中 后训练与偏好优化 :LLM(abstract);large language model(abstract);language model(abstract);preference optimization(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.07426 2025-10-28 cs.LG cs.AI 82%

RePO: Understanding Preference Learning Through ReLU-Based Optimization

Junkang Wu, Kexin Huang, Xue Wang, Jinyang Gao, Bolin Ding, Jiancan Wu, Xiangnan He, Xiang Wang

机构 * University of Science and Technology of China(中国科学技术大学) Alibaba Group(阿里巴巴集团) Institute of Dataspace, Hefei Comprehensive National Science Center(数据空间研究所,合肥综合性国家科学中心) MoE Key Lab of BIPC, University of Science and Technology of China(BIPC联合实验室,中国科学技术大学)

专题命中 后训练与偏好优化 :large language model(abstract);language model(abstract);RLHF(abstract);preference optimization(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.18849 2025-10-22 cs.CL cs.AI 82%

Towards Faithful and Controllable Personalization via Critique-Post-Edit Reinforcement Learning

Chenghao Zhu, Meiling Tao, Tiannan Wang, Dongyi Ding, Yuchen Eleanor Jiang, Wangchunshu Zhou

机构 * The Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳)) University of Electronic Science and Technology of China(电子科技大学) South China Agricultural University(华南农业大学)

专题命中 后训练与偏好优化 :large language model(abstract);language model(abstract);SFT(abstract);RLHF(abstract)

Comments work in progress

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.17225 2025-10-07 cs.CL cs.AI 82%

SSFO: Self-Supervised Faithfulness Optimization for Retrieval-Augmented Generation

Xiaqiang Tang, Yi Wang, Keyu Hu, Rui Xu, Chuang Li, Weigao Sun, Jian Li, Sihong Xie

机构 * The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州)) Chinese Academy of Sciences(中国科学院) Shanghai AI Lab(上海人工智能实验室) Tencent Hunyuan(腾讯文英)

专题命中 后训练与偏好优化 :large language model(abstract);language model(abstract);post-training(abstract);preference optimization(abstract)

Comments Working in progress

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.03206 2025-10-03 cs.CL cs.AI 82%

Enhancing Personalized Multi-Turn Dialogue with Curiosity Reward

Yanming Wan, Jiaxing Wu, Marwa Abdulhai, Lior Shani, Natasha Jaques

机构 * Google DeepMind(谷歌DeepMind) University of Washington(华盛顿大学) Google Research(谷歌研究) University of California, Berkeley(伯克利加州大学)

专题命中 后训练与偏好优化 :LLM(abstract);large language model(abstract);language model(abstract);RLHF(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2406.07780 2025-09-29 cs.LG cs.CL 82%

A Critical Look At Tokenwise Reward-Guided Text Generation

Ahmad Rashid, Ruotian Wu, Julia Grosse, Agustinus Kristiadi, Pascal Poupart

机构 * University of Waterloo(滑铁卢大学) Vector Institute(向量研究所) University of Tübingen(图宾根大学) Tübingen AI Center(图宾根人工智能中心) Western University(西方大学)

专题命中 后训练与偏好优化 :LLM(abstract);large language model(abstract);language model(abstract);RLHF(abstract)

Comments Work accepted at COLM 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.19775 2025-09-25 cs.CL cs.AI cs.CR 82%

bi-GRPO: Bidirectional Optimization for Jailbreak Backdoor Injection on LLMs

Wence Ji, Jiancan Wu, Aiying Li, Shuyi Zhang, Junkang Wu, An Zhang, Xiang Wang, Xiangnan He

机构 * University of Science and Technology of China(中国科学技术大学)

专题命中 后训练与偏好优化 :large language model(abstract);language model(abstract);SFT(abstract);RLHF(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.24846 2025-09-24 cs.AI cs.CL 82%

MiCRo: Mixture Modeling and Context-aware Routing for Personalized Preference Learning

Jingyan Shen, Jiarui Yao, Rui Yang, Yifan Sun, Feng Luo, Rui Pan, Tong Zhang, Han Zhao

机构 * University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) New York University(纽约大学) Rice University(稻谷大学)

专题命中 后训练与偏好优化 :large language model(abstract);language model(abstract);foundation model(abstract);RLHF(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏