arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

共收录 4556 信号源:cs.CL, cs.AI, cs.LG

1. 后训练与偏好优化 4556 篇

2410.04346 2025-10-24 cs.CL 84%

Permutative Preference Alignment from Listwise Ranking of Human Judgments

Yang Zhao, Yixin Wang, Mingzhang Yin

机构 * University of Texas at Austin(德克萨斯大学奥斯汀分校) University of Michigan, Ann Arbor(密歇根大学安娜堡分校) University of Florida(佛罗里达大学)

专题命中 后训练与偏好优化 :LLM(abstract);large language model(abstract);language model(abstract);RLHF(abstract)

Comments Published at EMNLP 2025 Main Conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.22624 2025-09-29 cs.CV cs.LG 84%

SPARK: Synergistic Policy And Reward Co-Evolving Framework

Ziyu Liu, Yuhang Zang, Shengyuan Ding, Yuhang Cao, Xiaoyi Dong, Haodong Duan, Dahua Lin, Jiaqi Wang

机构 * Shanghai Jiao Tong University(上海交通大学) Shanghai Artificial Intelligence Laboratory(上海人工智能实验室) Fudan University(复旦大学) The Chinese University of Hong Kong(香港中文大学) Shanghai Innovation Institute(上海创新研究院)

专题命中 后训练与偏好优化 :LLM(abstract);large language model(abstract);language model(abstract);pretraining(abstract)

Comments Project:https://github.com/InternLM/Spark

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.06124 2025-08-11 cs.CL 84%

AURA: Affordance-Understanding and Risk-aware Alignment Technique for Large Language Models

Sayantan Adak, Pratyush Chatterjee, Somnath Banerjee, Rima Hazra, Somak Aditya, Animesh Mukherjee

专题命中 后训练与偏好优化 :large language model(title);language model(title);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.02193 2025-07-29 cs.AI 84%

More is Less: The Pitfalls of Multi-Model Synthetic Preference Data in DPO Safety Alignment

Yifan Wang, Runjin Chen, Bolian Li, David Cho, Yihe Deng, Ruqi Zhang, Tianlong Chen, Zhangyang Wang, Ananth Grama, Junyuan Hong

机构 * Purdue University(普渡大学) The University of Texas at Austin(德克萨斯大学奥斯汀分校) The University of North Carolina at Chapel Hill(北卡罗来纳大学教堂山分校) University of California, Los Angeles(加州大学洛杉矶分校)

专题命中 后训练与偏好优化 :large language model(abstract);language model(abstract);post-training(abstract);RLHF(abstract)

Comments This version includes updated results and expanded discussion

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.02686 2025-06-13 cs.CL 84%

Sailing by the Stars: A Survey on Reward Models and Learning Strategies for Learning from Rewards

Xiaobao Wu

机构 * Nanyang Technological University(南洋理工大学)

专题命中 后训练与偏好优化 :LLM(abstract);large language model(abstract);language model(abstract);post-training(abstract)

Comments 36 Pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.16265 2025-05-23 cs.LG 84%

Think-RM: Enabling Long-Horizon Reasoning in Generative Reward Models

Ilgee Hong, Changlong Yu, Liang Qiu, Weixiang Yan, Zhenghao Xu, Haoming Jiang, Qingru Zhang, Qin Lu, Xin Liu, Chao Zhang, Tuo Zhao

专题命中 后训练与偏好优化 :large language model(abstract);language model(abstract);post-training(abstract);SFT(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.17112 2025-04-01 cs.LG 84%

Decoding Human Preferences in Alignment: An Improved Approach to Inverse Constitutional AI

Carl-Leander Henneking, Claas Beger

专题命中 后训练与偏好优化 :LLM(abstract);large language model(abstract);language model(abstract);RLHF(abstract)

Comments 9 Pages, 3 Figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2409.17401 2025-03-04 cs.LG stat.ML 84%

Zeroth-Order Policy Gradient for Reinforcement Learning from Human Feedback without Reward Inference

Qining Zhang, Lei Ying

专题命中 后训练与偏好优化 :LLM(abstract);large language model(abstract);language model(abstract);RLHF(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.19798 2025-02-28 cs.AI 84%

Developmental Support Approach to AI's Autonomous Growth: Toward the Realization of a Mutually Beneficial Stage Through Experiential Learning

Taichiro Endo

专题命中 后训练与偏好优化 :large language model(abstract);language model(abstract);post-training(abstract);SFT(abstract)

Comments 4pages, 3 figures

Journal ref Proc. 1st Workshop on Post-Singularity Symbiosis, PSS-2025-007, March 3, 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.11284 2025-02-18 cs.LG 84%

Balancing the Budget: Understanding Trade-offs Between Supervised and Preference-Based Finetuning

Mohit Raghavendra, Junmo Kang, Alan Ritter

专题命中 后训练与偏好优化 :large language model(abstract);language model(abstract);post-training(abstract);SFT(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2404.14723 2025-02-11 cs.CL 84%

Insights into Alignment: Evaluating DPO and its Variants Across Multiple Tasks

Amir Saeidi, Shivanshu Verma, Md Nayem Uddin, Chitta Baral

专题命中 后训练与偏好优化 :LLM(abstract);large language model(abstract);language model(abstract);SFT(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2408.17072 2024-12-20 cs.CL 84%

MaFeRw: Query Rewriting with Multi-Aspect Feedbacks for Retrieval-Augmented Large Language Models

Yujing Wang, Hainan Zhang, Liang Pang, Binghui Guo, Hongwei Zheng, Zhiming Zheng

专题命中 后训练与偏好优化 :large language model(title);language model(title);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.16586 2024-10-23 cs.AI cs.IR 84%

Optimizing LLMs with Direct Preferences: A Data Efficiency Perspective

Pietro Bernardelle, Gianluca Demartini

专题命中 后训练与偏好优化 :LLM(abstract);large language model(abstract);language model(abstract);RLHF(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.18840 2026-05-26 cs.LG cs.AI cs.CL 84%

The Growing Pains of Frontier Models: When Leaderboards Stop Separating and What to Measure Next

前沿模型的成长之痛:当排行榜不再区分以及接下来衡量什么

Adil Amin

机构 * Zehen Labs(泽亨实验室)

专题命中 后训练与偏好优化 :RLHF(abstract,abstract_cn);pretraining(abstract);post-training(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文通过分解SWE-bench和GPQA Diamond分数为种群耦合趋势和每版本残差(h场),诊断前沿模型能力之间的协作与权衡,并提供三步诊断法、每实验室测量优先级表及七个可证伪预测。

Comments 13 pages, 5 figures, 4 tables. Companion paper: "Lying Is Just a Phase: The Hidden Alignment Transition in Language Model Scaling." ( https://doi.org/10.48550/arXiv.2605.18838 ). Code: https://github.com/adilamin89/cape-scaling . Dashboard: https://zehenlabs.com/cape/

详情

展开后加载摘要…

URL PDF HTML 收藏
2310.16763 2023-10-26 cs.CL cs.AI cs.LG 84%

SuperHF: Supervised Iterative Learning from Human Feedback

Gabriel Mukobi, Peter Chatain, Su Fong, Robert Windesheim, Gitta Kutyniok, Kush Bhatia, Silas Alberti

专题命中 后训练与偏好优化 :language model(abstract,comments);large language model(abstract);SFT(abstract);RLHF(abstract)

Comments Accepted to the Socially Responsible Language Modelling Research (SoLaR) workshop at NeurIPS 2023

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.16831 2026-08-18 cs.AI cs.CL 新提交 84%

Policy Iteration with Human Feedback: Bringing Post-Training RL to In-context Learning

结合人类反馈的策略迭代:将后训练强化学习应用于上下文学习

Minh-Ha Nguyen, Cathy Shyr

机构 * Vanderbilt University(范德堡大学) Vanderbilt University Medical Center(范德堡大学医学中心)

专题命中 后训练与偏好优化 :post-training(title);language model(abstract);pretraining(abstract);分类 cs.CL、cs.AI

AI总结 该研究提出结合人类反馈的策略迭代(PIHF)方法,采用预训练语言模型为基底,经实验使其在罕见疾病诊断相关任务中显著提升了多个执行器的Recall@1指标,验证了其可行性。

Comments PIHF method paper

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.08904 2026-08-17 cs.CV cs.AI cs.LG 版本更新 84%

From Recovery to Drop-off: How Action Post-training Reduces a VLM's Late-Layer Depth Decodability

从恢复到骤降:动作后训练如何降低视觉语言模型的深层解码能力

Alexander Hackett, Arnaud Denis-Remillard, Axel Cassou

机构 * New York University(纽约大学) Reflex Université de Montréal(蒙特利尔大学) Maastricht University(马斯特里赫特大学)

专题命中 后训练与偏好优化 :post-training(title,abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 该研究探究动作后训练对VLM空间理解的影响,发现VLA存在深层解码能力的“基底”差距与“悬崖”骤降,定位其源于深层MLP干扰,消融该模块可恢复多数解码性能。

Comments Accepted to the archival proceedings track of the Embodied Multimodal Reasoning (EMR) Workshop at ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.06547 2026-08-13 cs.LG cs.AI cs.DC 版本更新 84%

A-3PO: Accelerating Asynchronous LLM Training with Staleness-aware Proximal Policy Approximation

A-3PO:通过意识滞后的近端策略优化加速异步大语言模型训练

Xiaocan Li, Shiliang Wu, Zheng Shen

机构 * Huawei Canada(华为加拿大)

专题命中 后训练与偏好优化 :LLM(title);large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 A-3PO通过近似近端策略优化方法,减少大语言模型异步训练中的计算开销,实现1.8倍的加速同时保持性能

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.10196 2026-08-12 cs.LG cs.AI 新提交 84%

ELMER: Evolutionary Language Model that Explores and Refines

ELMER:探索与优化的进化语言模型

Matthew Siper, Ahmed Khalifa, Julian Togelius

机构 * New York University(纽约大学) University of Malta(马耳他大学)

专题命中 后训练与偏好优化 :language model(title,abstract);preference optimization(abstract);分类 cs.AI、cs.LG

AI总结 本研究提出进化语言模型 ELMER,通过微调 Qwen3-8B 并结合 oDPO 优化,实现自然语言策略搜索与编译,提升进化搜索效率,证明语言可作为可执行程序空间的可引导搜索表示。

Comments Submitted to AAAI Conference 2026, 8 pages, 6 figures, 1 table

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.04713 2026-08-11 cs.LG cs.AI 版本更新 84%

RSPO: Reward-Swap Policy Optimization for Multi-Turn LLM Agents

RSPO:用于多轮语言模型智能体的奖励交换策略优化

Qiang Liu, Taian Guo, Ruizhi Qiao, Xing Sun

机构 * Tencent YouTu Lab(腾讯优图实验室)

专题命中 后训练与偏好优化 :LLM(title);large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 研究多轮语言模型智能体训练问题,针对稀疏结果奖励训练收敛慢等问题,提出奖励交换策略优化方法,利用密集过程奖励信息,确保轨迹多样性和目标与真实奖励一致性,提升模型性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.03204 2026-08-05 cs.CL cs.AI 新提交 84%

Aligning Large Vision-Language Models at Test Time: A Trajectory-Guided Structured Sampling Approach

测试时对齐大型视觉语言模型:一种轨迹引导的结构化采样方法

Tianbao Jiang, Weicong Ni, Gerard de Melo, Linlin Wang

专题命中 后训练与偏好优化 :language model(title,abstract);post-training(abstract);分类 cs.CL、cs.AI

AI总结 针对现有视觉语言模型测试时对齐方法资源密集、训练与推理分布不匹配的问题,提出轨迹引导结构化采样的测试时对齐方法,在多模态推理数据集上提升准确率且推理开销可控。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.20435 2026-07-24 cs.CL cs.AI 新提交 84%

Making Open-Source Text LLM Watermarks Durable Against Merging

使开源文本语言模型水印在合并后仍具耐久性

Luisa Scharff, Thibaud Gloaguen, Robin Staab, Martin Vechev

机构 * ETH Zurich(苏黎世联邦理工学院)

专题命中 后训练与偏好优化 :LLM(title);post-training(abstract);prompting(abstract);分类 cs.CL、cs.AI

AI总结 研究如何让开源文本语言模型水印在模型合并后仍具耐久性,提出合并对抗训练算法,该算法能将水印融入模型权重,在保留下游能力的同时优于所有基线,还评估了针对现实合并场景的水印,表明对抗训练可提高水印耐久性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.19824 2026-07-23 cs.AI cs.CL 新提交 84%

Rewarding Better Thinking for LLM Preference Alignment

奖励更好的思维以实现大语言模型偏好对齐

Xubo Liu, Wenya Guo, Ruxue Yan, Xinying Qian, Ying Zhang

专题命中 后训练与偏好优化 :LLM(title,abstract);post-training(abstract);分类 cs.CL、cs.AI

AI总结 研究大语言模型偏好对齐问题,提出思维清单奖励(TCR)方法,将偏好对转化为思维清单评估推理轨迹,引入EMA残差公式减少与结果监督重叠,实验证明该方法能提升对齐性能。

Comments under review

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.13389 2026-07-16 cs.LG cs.CL 新提交 84%

Where Should RL Post-Training Compute Go? Model Size, Search, Learning, and Feedback

强化学习训练后计算资源应投向何处?模型大小、搜索、学习与反馈

Patrick Wilhelm, Odej Kao

机构 * Technische Universität Berlin(柏林工业大学)

专题命中 后训练与偏好优化 :post-training(title,abstract);foundation model(abstract);分类 cs.CL、cs.LG

AI总结 研究强化学习训练后计算资源分配问题,引入浮点运算核算框架,通过LoRA适配的Qwen2.5策略发现条件分配前沿,揭示模型选择与训练分配关联及奖励系统对核算影响,提出RACE协议,建议相关论文报告总浮点运算及计算分配方式。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.07693 2026-07-09 cs.LG cs.AI cs.CV 新提交 84%

Selective Timestep Weighting and Advantage-Based Replay for Sample-Efficient Diffusion RLHF

用于样本高效扩散强化学习从人类反馈中学习的选择性时间步加权和基于优势的重放

Eric Zhu, Abhinav Shrivastava, Soumik Mukhopadhyay

机构 * Carnegie Mellon University(卡内基梅隆大学) University of Maryland, College Park(马里兰大学帕克分校)

专题命中 后训练与偏好优化 :RLHF(title,abstract);分类 cs.AI、cs.LG

AI总结 研究如何提高扩散模型中强化学习从人类反馈的效率,提出选择性时间步加权和基于优势的重放两种互补策略,通过强调信息丰富的时间步和轨迹优化,提升反馈效率,样本效率比基线提高6倍。

Comments 19 pages, 18 figures, 4 tables. Submission under review. A shorter, non-archival 4-page abstract version of this work was accepted to CVPR 2026 Workshops (GCV, CVEU)

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.07646 2026-07-09 cs.AI cs.CL 新提交 84%

RL Post-Training Builds Compositional Reasoning Strategies

强化学习后训练构建组合推理策略

Azwar Abdulsalam, Nishil Patel, Andrew Saxe

专题命中 后训练与偏好优化 :post-training(title,abstract);pretraining(abstract);分类 cs.CL、cs.AI

AI总结 研究强化学习后训练能否组合原始技能成高级策略,通过在可观察环境实验发现,强化学习能解决预训练模型难题,通过分阶段组合机制重组能力,组合过程可复用巩固,与拒绝微调关键差异在选择性,预训练消融表明其对组合策略出现有影响。

Comments 8 pages, 6 figures. Accepted to the 2nd Workshop on Compositional Learning at ICML 2026, Seoul, South Korea

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.10938 2026-07-07 cs.LG cs.AI 版本更新 84%

Safe RLHF Beyond Expectation: Stochastic Dominance for Universal Spectral Risk Control

超越期望的安全基于人类反馈的强化学习:用于通用谱风险控制的随机占优

Yaswanth Chittepu, Ativ Joshi, Rajarshi Bhattacharjee, Scott Niekum

专题命中 后训练与偏好优化 :RLHF(title,abstract);分类 cs.AI、cs.LG

AI总结 研究基于人类反馈的安全强化学习,提出用一阶随机占优约束取代标量期望成本约束的框架RAD,通过最优传输框架比较成本分布,引入分位数加权FSD约束,实证显示其提升无害性且增强分布外无害性评估的鲁棒性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.01763 2026-07-03 cs.LG cs.CL 新提交 84%

Denser $\neq$ Better: Limits of On-Policy Self-Distillation for Continual Post-Training

更密集 ≠ 更好:持续后训练中同策略自蒸馏的局限性

Meng Wang, Haohan Zhao, Wenzhuo Liu, Lu Yang, Geng Liu, Haiyang Guo, Guo-Sen Xie, Gaofeng Meng, Hongbin Liu, Fei Zhu

专题命中 后训练与偏好优化 :post-training(title,abstract);foundation model(abstract);分类 cs.CL、cs.LG

AI总结 研究通过自蒸馏策略优化(SDPO)发现,同策略自蒸馏在持续后训练中会加剧遗忘甚至崩溃,而GRPO等强化学习方法更保守地保留先前能力,表明密集自蒸馏并非默认的稳定器。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.12893 2026-07-01 cs.CV cs.AI cs.LG cs.NE stat.ML 版本更新 84%

Finite Difference Flow Optimization for RL Post-Training of Text-to-Image Models

文本到图像模型强化学习后训练的有限差分流优化

David McAllister, Miika Aittala, Tero Karras, Janne Hellsten, Angjoo Kanazawa, Timo Aila, Samuli Laine

机构 * UC Berkeley(加州大学伯克利分校) NVIDIA(英伟达)

专题命中 后训练与偏好优化 :post-training(title,abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 提出一种在线强化学习变体,通过采样配对轨迹并将流速度拉向更优图像方向来降低模型更新方差,将整个采样过程视为单一动作,实现更快的收敛和更高的输出质量与提示对齐。

Comments Code available at https://github.com/NVlabs/finite-difference-flow-optimization

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.29604 2026-06-30 cs.LG cs.AI 84%

Mechanistically Eliciting Latent Behaviors in Language Models

机械性地引发语言模型中的潜在行为

Andrew Mack, Nina Panickssery, Alexander Matt Turner

机构 * Principles of Intelligence(智能原理研究所) Anthropic(Anthropic公司) Independent(独立)

专题命中 后训练与偏好优化 :language model(title);LLM(abstract,abstract_cn);分类 cs.AI、cs.LG

AI总结 提出因果扰动引发(CPE)方法,通过无监督方式发现可解释的低秩适配器,以揭示语言模型中的隐藏行为模式,并展示其在数据效率、安全评估和模型对齐方面的优势。

详情

展开后加载摘要…

URL PDF HTML 收藏