arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

共收录 4541 信号源:cs.CL, cs.AI, cs.LG

1. 后训练与偏好优化 4541 篇

2602.20532 2026-02-25 cs.LG cs.AI cs.CL 89%

Actor-Curator: Co-adaptive Curriculum Learning via Policy-Improvement Bandits for RL Post-Training

Actor-Curator: 通过策略改进带状机为RL后训练实现联合适应课程学习

Zhengyao Gu, Jonathan Light, Raul Astudillo, Ziyu Ye, Langzhou He, Henry Peng Zou, Wei Cheng, Santiago Paternain, Philip S. Yu, Yisong Yue

机构 * University of Illinois Chicago(伊利诺伊大学香槟分校) Caltech(加州理工学院) RPI(罗切斯特理工学院) MBZUAI(澳门大学人工智能研究院) University of Chicago(芝加哥大学) NEC Laboratories America(NEC美国实验室)

专题命中 后训练与偏好优化 :post-training(title,abstract);LLM(abstract);large language model(abstract);language model(abstract)

AI总结 ACTOR-CURATOR通过策略改进带状机实现RL后训练的联合适应课程学习,有效提升训练稳定性和效率。

Comments 37 pages, 8 figures, 1 table. Preprint under review. Equal contribution by first two authors

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.08256 2025-10-10 cs.LG cs.AI cs.CL 89%

Mix- and MoE-DPO: A Variational Inference Approach to Direct Preference Optimization

Jason Bohne, Pawel Polak, David Rosenberg, Brian Bloniarz, Gary Kazantsev

机构 * Department of Applied Mathematics and Statistics(应用数学与统计学系) Stony Brook University(石溪大学) Institute for Advanced Computational Science(先进计算科学研究所) Center of Excellence in Wireless and Information Technology (CEWIT)(无线与信息技术卓越中心) AI Innovation Institute(人工智能创新研究院) Bloomberg(彭博) Toronto, ON M5J 2S1(多伦多,ON M5J 2S1) San Francisco, CA 94105(旧金山,CA 94105) Bloomberg New York, NY 10022(纽约,NY 10022)

专题命中 后训练与偏好优化 :preference optimization(title,abstract);LLM(abstract);large language model(abstract);language model(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.08022 2025-10-10 cs.LG cs.AI cs.CL cs.CV 89%

Modality-Balancing Preference Optimization of Large Multimodal Models by Adversarial Negative Mining

Chenxi Liu, Tianyi Xiong, Yanshuo Chen, Ruibo Chen, Yihan Wu, Junfeng Guo, Tianyi Zhou, Heng Huang

机构 * University of Maryland, College Park(马里兰大学学院 park)

专题命中 后训练与偏好优化 :preference optimization(title,abstract);LLM(abstract);large language model(abstract);language model(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.02832 2025-07-24 cs.CL cs.AI cs.LG 89%

AlignDistil: Token-Level Language Model Alignment as Adaptive Policy Distillation

Songming Zhang, Xue Zhang, Tong Zhang, Bojie Hu, Yufeng Chen, Jinan Xu

机构 * Key Laboratory of Big Data & Artificial Intelligence in Transportation, (Beijing Jiaotong University), Ministry of Education(大数据与人工智能交通运输联合实验室,(北京交通大学)教育部) School of Computer Science and Technology, Beijing Jiaotong University, Beijing, China(计算机科学与技术学院,北京交通大学,北京,中国) Tencent Inc, China(腾讯公司,中国)

专题命中 后训练与偏好优化 :language model(title,abstract);LLM(abstract);large language model(abstract);RLHF(abstract)

Comments ACL 2025 Main Conference, code available at: https://github.com/songmzhang/AlignDistil

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.10148 2025-07-22 cs.LG cs.AI cs.CL 89%

AlphaDPO: Adaptive Reward Margin for Direct Preference Optimization

Junkang Wu, Xue Wang, Zhengyi Yang, Jiancan Wu, Jinyang Gao, Bolin Ding, Xiang Wang, Xiangnan He

机构 * MoE Key Lab of BIPC, University of Science(BIPC联合实验室,科学与技术大学) Alibaba Group(阿里巴巴集团)

专题命中 后训练与偏好优化 :preference optimization(title,abstract);LLM(abstract);large language model(abstract);language model(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2407.10490 2025-07-01 cs.LG cs.AI cs.CL 89%

Learning Dynamics of LLM Finetuning

Yi Ren, Danica J. Sutherland

专题命中 后训练与偏好优化 :LLM(title,abstract);large language model(abstract);language model(abstract);instruction tuning(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.07595 2025-06-16 cs.LG cs.AI cs.CL 89%

Entropy Controllable Direct Preference Optimization

Motoki Omura, Yasuhiro Fujita, Toshiki Kataoka

机构 * The University of Tokyo(东京大学)

专题命中 后训练与偏好优化 :preference optimization(title,abstract);large language model(abstract);language model(abstract);post-training(abstract)

Comments ICML 2025 Workshop on Models of Human Feedback for AI Alignment

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.02197 2025-06-12 cs.AI cs.CL cs.LG 89%

Beyond Bradley-Terry Models: A General Preference Model for Language Model Alignment

Yifan Zhang, Ge Zhang, Yue Wu, Kangping Xu, Quanquan Gu

机构 * IIIS, Tsinghua University, Beijing, China(清华大学信息科学技术学院,北京,中国) Shanghai Qi Zhi Institute, Shanghai, China(上海启智研究院,上海,中国) Department of Computer Science, University of California, Los Angeles, California, USA(计算机科学系,加州大学洛杉矶分校,美国,加州)

专题命中 后训练与偏好优化 :language model(title,abstract);foundation model(abstract);post-training(abstract);RLHF(abstract)

Comments Accepted to the 42nd International Conference on Machine Learning (ICML 2025)

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.07703 2025-03-12 cs.CV 89%

Seedream 2.0: A Native Chinese-English Bilingual Image Generation Foundation Model

Lixue Gong, Xiaoxia Hou, Fanshi Li, Liang Li, Xiaochen Lian, Fei Liu, Liyang Liu, Wei Liu, Wei Lu, Yichun Shi, Shiqi Sun, Yu Tian, Zhi Tian, Peng Wang, Xun Wang, Ye Wang, Guofeng Wu, Jie Wu, Xin Xia, Xuefeng Xiao, Linjie Yang, Zhonghua Zhai, Xinyu Zhang, Qi Zhang, Yuwei Zhang, Shijia Zhao, Jianchao Yang, Weilin Huang

专题命中 后训练与偏好优化 :foundation model(title,abstract);large language model(abstract);language model(abstract);post-training(abstract)

Comments Official Page: https://team.doubao.com/tech/seedream

详情

展开后加载摘要…

URL PDF HTML 收藏
2402.05133 2024-12-10 cs.CL cs.AI cs.LG 89%

Personalized Language Modeling from Personalized Human Feedback

Xinyu Li, Ruiyang Zhou, Zachary C. Lipton, Liu Leqi

专题命中 后训练与偏好优化 :language model(title,abstract);LLM(abstract);large language model(abstract);RLHF(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.02685 2024-12-04 cs.CL cs.AI cs.LG 89%

T-REG: Preference Optimization with Token-Level Reward Regularization

Wenxuan Zhou, Shujian Zhang, Lingxiao Zhao, Tao Meng

专题命中 后训练与偏好优化 :preference optimization(title,abstract);large language model(abstract);language model(abstract);RLHF(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2405.07863 2024-11-13 cs.LG cs.AI cs.CL stat.ML 89%

RLHF Workflow: From Reward Modeling to Online RLHF

Hanze Dong, Wei Xiong, Bo Pang, Haoxiang Wang, Han Zhao, Yingbo Zhou, Nan Jiang, Doyen Sahoo, Caiming Xiong, Tong Zhang

专题命中 后训练与偏好优化 :RLHF(title,abstract);LLM(abstract);large language model(abstract);language model(abstract)

Comments Published in Transactions on Machine Learning Research (09/2024)

详情

展开后加载摘要…

URL PDF HTML 收藏
2409.20370 2024-10-01 cs.LG cs.AI cs.CL 89%

The Perfect Blend: Redefining RLHF with Mixture of Judges

Tengyu Xu, Eryk Helenowski, Karthik Abinav Sankararaman, Di Jin, Kaiyan Peng, Eric Han, Shaoliang Nie, Chen Zhu, Hejia Zhang, Wenxuan Zhou, Zhouhao Zeng, Yun He, Karishma Mandyam, Arya Talabzadeh, Madian Khabsa, Gabriel Cohen, Yuandong Tian, Hao Ma, Sinong Wang, Han Fang

专题命中 后训练与偏好优化 :RLHF(title,abstract);LLM(abstract);large language model(abstract);language model(abstract)

Comments submitted to conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2406.04274 2024-06-07 cs.LG cs.AI cs.CL 89%

Self-Play with Adversarial Critic: Provable and Scalable Offline Alignment for Language Models

Xiang Ji, Sanjeev Kulkarni, Mengdi Wang, Tengyang Xie

专题命中 后训练与偏好优化 :language model(title,abstract);LLM(abstract);large language model(abstract);RLHF(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2310.02263 2024-04-04 cs.CL cs.AI cs.LG 89%

Automatic Pair Construction for Contrastive Post-training

Canwen Xu, Corby Rosset, Ethan C. Chau, Luciano Del Corro, Shweti Mahajan, Julian McAuley, Jennifer Neville, Ahmed Hassan Awadallah, Nikhil Rao

专题命中 后训练与偏好优化 :post-training(title,abstract);LLM(abstract);large language model(abstract);language model(abstract)

Comments NAACL 2024 (Findings)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.16177 2026-08-19 cs.CR cs.AI 版本更新 89%

Measuring Obedience to Authority Across Large Language Models with the Milgram Paradigm

用米尔格拉姆范式测量大型语言模型对权威的服从性

Hidayet Aksu

专题命中 后训练与偏好优化 :large language model(title,abstract);language model(title,abstract);post-training(abstract);分类 cs.AI

AI总结 该研究将米尔格拉姆服从范式迁移至LLMs,测量42个模型的服从性概况,发现服从性异质性高、具模型特异性,受情境因素影响,且反映检查点而非模型谱系。

Comments 11 pages, 7 figures,

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.14498 2026-08-17 cs.LG cs.DC 新提交 89%

Rollplex: Cross-Phase GPU Spatial Sharing for Vision Language Model Post-Training

Rollplex:面向视觉语言模型后训练的跨阶段GPU空间共享

Hanfeng Lu, Tianyu Feng, Suyi Li, Yuheng Zhao, Wei Gao, Shaopan Xiong, Ju Huang, Siran Yang, Jiamang Wang, Lin Qu, Wei Wang

机构 * HKUST(香港科技大学) Alibaba Inc(阿里巴巴公司)

专题命中 后训练与偏好优化 :language model(title,abstract);post-training(title,abstract);分类 cs.LG

AI总结 Rollplex是一种跨阶段GPU空间共享运行时,通过解耦RL后训练的参考与训练阶段、优化内存与并行度,提升VLMs后训练的GPU利用率与训练速度。

Comments 16 pages, 10 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.00782 2026-08-04 cs.CL 新提交 89%

Distill Where You Fail: Recovering Learning Signals of Negative RL-Groups from Adaptive Teacher Guidance

从自适应教师指导中恢复负强化学习组的学习信号:针对失败情况进行知识蒸馏

Zhuowen Han, Jinwei Xiao, Zhengxi Lu, Renren Jin, Zhiyuan Yao, Yuxin Liu, Hongyan Hao, Yueqing Sun, Yu Yang, Qi GU, Xunliang Cai, Deyi Xiong

机构 * Tianjin University(天津大学) Meituan(美团)

专题命中 后训练与偏好优化 :SFT(summary_cn,abstract);LLM(abstract_cn);large language model(abstract);language model(abstract)

AI总结 该研究针对GRPO与OPD简单结合的性能缺陷,提出RSTG方法,通过选择性自适应蒸馏及补充SFT,使数学任务性能提升4.02%、代码任务提升3.05%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.18747 2026-06-18 cs.RO cs.AI 新提交 89%

Generating Natural and Expressive Robot Gestures through Iterative Reinforcement Learning with Human Feedback using LLMs

通过基于人类反馈的迭代强化学习利用大语言模型生成自然且富有表现力的机器人手势

Chris Lee, Flora Salim, Benjamin Tag, Francisco Cruz

机构 * University of New South Wales(新南威尔士大学) Universidad Central de Chile(智利中央大学)

专题命中 后训练与偏好优化 :RLHF(summary_cn,abstract);LLM(abstract,abstract_cn);large language model(abstract);language model(abstract)

AI总结 针对社交机器人手势生成僵硬问题,提出将ChatGPT集成到Pepper机器人中生成共语手势,并引入基于人类反馈的迭代强化学习(RLHF)优化手势,实验表明RLHF提升了手势的表现力、相关性和流畅性。

Comments 8 Pages, 6 Figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.10217 2026-06-10 cs.LG cs.CR 新提交 89%

Alignment Defends LLMs from Property Inference Attacks

对齐防御LLM免受属性推断攻击

Pengrun Huang, Chhavi Yadav, Ruihan Wu, Kamalika Chaudhuri

机构 * University of California, San Diego(加州大学圣地亚哥分校) Carnegie Mellon University(卡内基梅隆大学) Simons Institute, UC Berkeley(伯克利大学Simons研究所)

专题命中 后训练与偏好优化 :LLM(title_cn);RLHF(abstract,abstract_cn);large language model(abstract);language model(abstract)

AI总结 提出基于对齐的防御方法,通过后训练调整模型输出分布,在不修改训练数据的情况下缓解属性推断攻击,并保持效用与机密性的平衡。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.07535 2026-06-09 cs.CL 新提交 89%

Multilingual Refusal Alignment for Safer Large Language Models

多语言拒绝对齐:构建更安全的大型语言模型

Aleksandra Krasnodębska, Wojciech Kusa, Aldo Lipani

机构 * NASK National Research Institute(国家研究 institute) University College London(伦敦大学学院)

专题命中 后训练与偏好优化 :large language model(title,abstract);language model(title,abstract);preference optimization(abstract);分类 cs.CL

AI总结 本研究系统探究多语言对齐动态,通过引入覆盖12种欧洲语言的RefusEU数据集和DPO实验,发现仅用英语对齐不足以保障跨语言安全,而多语言训练可在不降低通用性能的前提下提升安全性。

Comments Accepted to Findings ACL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.22478 2026-05-20 cs.LG 89%

Transformation-Augmented GRPO for Enhancing Exploration in Reasoning of Large Language Models

增强推理探索的变换增强GRPO

Khiem Le, Phuc Nguyen, Youssef Mroueh, Chi-Heng Lin, Shangqian Gao, Ting Hua, Nitesh V. Chawla

机构 * University of Notre Dame(诺特大学) IBM Research(IBM研究院) Meta AI Florida State University(佛罗里达州立大学)

专题命中 后训练与偏好优化 :large language model(title,abstract);language model(title,abstract);LLM(abstract_cn);分类 cs.LG

AI总结 本文提出变换增强GRPO(TA-GRPO)方法,通过问题重述解决大语言模型强化学习中梯度消失和多样性崩溃问题,提升模型在推理任务中的探索能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.25448 2026-05-20 cs.CR cs.CL 89%

Fingerprinting LLMs via Prompt Injection

通过提示注入指纹化LLM

Yuepeng Hu, Zhengyuan Jiang, Mengyuan Li, Osama Ahmed, Zhicong Huang, Cheng Hong, Neil Gong

机构 * Duke University(杜克大学) Ant Group(蚂蚁集团)

专题命中 后训练与偏好优化 :LLM(title_cn,summary_cn);large language model(abstract);language model(abstract);post-training(abstract)

AI总结 本文提出LLMPrint框架,通过利用LLM对提示注入的固有脆弱性来构建指纹,以解决已发布模型的溯源问题,其核心方法是优化提示以获得唯一且抗后处理的指纹,实验显示其在高召回率下保持低误报率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.22664 2026-05-19 cs.AI 89%

Real-Time Aligned Reward Model beyond Semantics

实时对齐奖励模型超越语义

Zixuan Huang, Xin Xia, Yuxi Ren, Jianbin Zheng, Xuefeng Xiao, Hongyan Xie, Li Huaqiu, Songshi Liang, Zhongxiang Dai, Fuzhen Zhuang, Jianxin Li, Yikun Ban, Deqing Wang

机构 * Beihang University(北京航空航天大学) Tsinghua University(清华大学) Renmin University of China(中国人民大学) The Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳))

专题命中 后训练与偏好优化 :RLHF(summary_cn,abstract);LLM(abstract,abstract_cn);large language model(abstract);language model(abstract)

AI总结 本文提出R2M框架,通过实时利用策略模型反馈来对齐策略分布偏移,解决RLHF中奖励过拟合问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.01123 2026-05-05 cs.AI 89%

PERSA: Reinforcement Learning for Professor-Style Personalized Feedback with LLMs

PERSA:利用强化学习生成教授风格的个性化反馈

Ravi Ranjan, Utkarsh Grover, Xiaomin Lin, Agoritsa Polyzou

机构 * Florida International University(佛罗里达国际大学) University of South Florida(佛罗里达州立大学)

专题命中 后训练与偏好优化 :LLM(summary_cn,abstract);RLHF(abstract,abstract_cn);large language model(abstract);language model(abstract)

AI总结 PERSA通过结合监督微调、奖励建模和PPO,利用LLM生成符合教授风格的编程反馈,提升反馈的风格匹配度和准确性。

Comments 18 pages, 6 figures, 7 tables, accepted to conference ACL-2026, BEA

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.05469 2026-04-08 stat.ME cs.LG stat.ML 89%

Task Ecologies and the Evolution of World-Tracking Representations in Large Language Models

任务生态与大语言模型中世界追踪表示的进化

Giulio Valentino Dalla Riva

机构 * Baffelan OÜ

专题命中 后训练与偏好优化 :language model(title,abstract);large language model(title);small language model(abstract);post-training(abstract)

AI总结 研究语言模型作为演化的模型生物,探讨自回归下一个token学习何时选择世界追踪表示,提出生态真实性概念及最小复杂度零超额解,分析transformer家族中固定编码分析的应用条件及失败模式。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.14347 2026-03-17 cs.CL cs.CY 89%

Motivation in Large Language Models

大语言模型中的动机

Omer Nahum, Asael Sklar, Ariel Goldstein, Roi Reichart

专题命中 后训练与偏好优化 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.CL

AI总结 研究大语言模型是否表现出类似人类的动机特征,通过实验发现其动机报告与行为、任务类型及外部因素相关,揭示了动机在模型行为中的系统性关联。

Comments Preprint. Under review

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.13212 2026-03-17 cs.LG 89%

Towards Understanding Valuable Preference Data for Large Language Model Alignment

迈向理解大型语言模型对齐的有价值偏好数据

Zizhuo Zhang, Qizhou Wang, Shanshan Ye, Jianing Zhu, Jiangchao Yao, Bo Han, Masashi Sugiyama

专题命中 后训练与偏好优化 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.LG

AI总结 本文研究了大型语言模型对齐中偏好数据的质量问题,提出截断影响函数(TIF)评估数据质量,并引入两种计算更简单的评分函数以提高偏好数据选择的准确性。

Comments Accepted by ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.00724 2026-03-03 cs.CL 89%

RLAR: An Agentic Reward System for Multi-task Reinforcement Learning on Large Language Models

RLAR:一种用于大型语言模型多任务强化学习的代理奖励系统

Andrew Zhuoer Feng, Cunxiang Wang, Bosi Wen, Yidong Wang, Yu Luo, Hongning Wang, Minlie Huang

机构 * Tsinghua Univeristy(清华大学) Peking University(北京大学)

专题命中 后训练与偏好优化 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.CL

AI总结 RLAR通过动态生成奖励函数提升大型语言模型在多任务强化学习中的性能和泛化能力。

Comments 25 pages, 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.21728 2026-02-26 cs.CL 89%

Explore-on-Graph: Incentivizing Autonomous Exploration of Large Language Models on Knowledge Graphs with Path-refined Reward Modeling

在知识图谱上探索:通过路径细化奖励建模激励大语言模型自主探索

Shiqi Yan, Yubo Chen, Ruiqi Zhou, Zhengxi Yao, Shuai Chen, Tianyi Zhang, Shijie Zhang, Wei Qiang Zhang, Yongfeng Huang, Haixin Duan, Yunqi Zhang

机构 * Zhongguancun Laboratory, Beijing, China(中关村实验室,北京,中国) Department of Electronic Engineering, Tsinghua University, Beijing, China(电子工程系,清华大学,北京,中国) Institute for Network Sciences and Cyberspace, Tsinghua University, Beijing, China(网络科学与网络空间研究院,清华大学,北京,中国) Ant International, Ant Group, Hangzhou, Zhejiang, China(蚂蚁集团,杭州,浙江,中国)

专题命中 后训练与偏好优化 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.CL

AI总结 本文提出Explore-on-Graph框架,通过强化学习和路径细化奖励建模,使大语言模型在知识图谱上自主探索更广泛的推理空间,实现对分布外推理问题的高效泛化。

Comments Published as a conference paper at ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏