arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

共收录 4535 信号源:cs.CL, cs.AI, cs.LG

1. 后训练与偏好优化 4535 篇

2402.04867 2024-02-12 cs.IR 67%

Multimodal Query Suggestion with Multi-Agent Reinforcement Learning from Human Feedback

Zheng Wang, Bingzheng Gan, Wei Shi

专题命中 后训练与偏好优化 :large language model(abstract);language model(abstract)

Comments This paper has been accepted by WWW 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2311.15648 2023-11-28 cs.CV cs.AI cs.CL cs.LG cs.RO 67%

Reinforcement Learning from Diffusion Feedback: Q* for Image Search

Aboli Marathe

专题命中 后训练与偏好优化 :language model(abstract);分类 cs.CL、cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2306.01540 2023-06-05 cs.RO 67%

CLIPGraphs: Multimodal Graph Networks to Infer Object-Room Affinities

Ayush Agrawal, Raghav Arora, Ahana Datta, Snehasis Banerjee, Brojeshwar Bhowmick, Krishna Murthy Jatavallabhula, Mohan Sridharan, Madhava Krishna

专题命中 后训练与偏好优化 :large language model(abstract);language model(abstract)

Journal ref RO-MAN 2023 Conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2203.07472 2022-03-16 cs.CL cs.AI cs.LG 67%

Uncertainty Estimation for Language Reward Models

Adam Gleave, Geoffrey Irving

专题命中 后训练与偏好优化 :language model(abstract);分类 cs.CL、cs.AI、cs.LG

Comments 8 pages main paper, 17 pages total

详情

展开后加载摘要…

URL PDF HTML 收藏
2009.01325 2022-02-17 cs.CL cs.AI cs.LG 67%

Learning to summarize from human feedback

Nisan Stiennon, Long Ouyang, Jeff Wu, Daniel M. Ziegler, Ryan Lowe, Chelsea Voss, Alec Radford, Dario Amodei, Paul Christiano

专题命中 后训练与偏好优化 :language model(abstract);分类 cs.CL、cs.AI、cs.LG

Comments NeurIPS 2020

详情

展开后加载摘要…

URL PDF HTML 收藏
2402.06079 2024-04-18 q-bio.GN cs.AI cs.LG 66%

DiscDiff: Latent Diffusion Model for DNA Sequence Generation

Zehui Li, Yuhao Ni, William A V Beardall, Guoxuan Xia, Akashaditya Das, Guy-Bart Stan, Yiren Zhao

专题命中 后训练与偏好优化 :post-training(abstract,comments);分类 cs.AI、cs.LG

Comments Different from the prior work "Latent Diffusion Model for DNA Sequence Generation" (arXiv:2310.06150), we updated the evaluation framework and compared the DiscDiff with other methods comprehensively. In addition, a post-training framework is proposed to increase the quality of generated sequences

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.18931 2026-08-20 cs.CL cs.AI 新提交 62%

Test-Time Scaling in the Wild: Why Exploitation, Not Exploration, Is the Bottleneck

野外测试时缩放:为何利用而非探索是瓶颈

Davide Romano, Kanak Raj, Jerrod Parker, Daniele Giofrè

机构 * Thomson Reuters(汤姆森路透)

专题命中 后训练与偏好优化 :language model(abstract);分类 cs.CL、cs.AI

AI总结 该研究通过首个计算归一化对比发现,测试时缩放(TTS)中从候选池选择的利用环节是瓶颈,跨候选合成(Fusion)仅恢复约40%可用质量,探索缩放有效但利用失效。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.18351 2026-08-20 cs.CR cs.AI cs.LG cs.SY eess.SY 新提交 62%

Task-Conditioned Least-Privilege Learning for Executable Terminal and MCP Agents

面向可执行终端与MCP智能体的任务条件最小权限学习

Alexander Tu, Michael Tu

专题命中 后训练与偏好优化 :post-training(abstract);分类 cs.AI、cs.LG

AI总结 本研究提出任务条件最小权限学习框架,通过后训练优化4B参数模型的权限选择,使智能体超额权限错误率大幅降低,安全成功率显著提升,可作为工具使用智能体的额外控制层。

Comments This work has been submitted to the IEEE for possible publication. Copyright may be transferred without notice, after which this version may no longer be accessible

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.13698 2026-08-17 cs.CL cs.LG 新提交 62%

GRPO Beyond English: A Large-Scale Study of GRPO in Non-English and Multilingual Settings

超越英语的GRPO:非英语与多语言场景下GRPO的大规模研究

Konstantin Dobler, Federico Scozzafava, Jonathan Janke, Mohamed Ali, Simon Lehnerer

机构 * Apple(苹果公司) Hasso Plattner Institute(哈索·普拉特纳研究所) ELLIS Unit Potsdam(波茨坦ELLIS单元)

专题命中 后训练与偏好优化 :language model(abstract);分类 cs.CL、cs.LG

AI总结 该研究针对非英语及多语言场景开展GRPO大规模实证,发现母语训练推理与英语训练差距小、存在跨语言迁移但趋势依赖模型语言,指出非英语RLVR有跨语言增益但需全面评估退化问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.12192 2026-08-13 cs.AI cs.LG 新提交 62%

How to Spend Your Oracle Budget: Practical Guidance for Protein Structure Prediction Models

如何使用你的专家预算:蛋白质结构预测模型的实用指南

Aleksandra Kalisz, Jack Simons, Krisztina Sinkovics, Noam Ghenassia, Shikha Surana, Henry Moss, Paul Duckworth

机构 * InstaDeep Ltd(InstaDeep公司) University of Oxford(牛津大学) Lancaster University(兰卡斯特大学)

专题命中 后训练与偏好优化 :foundation model(abstract);分类 cs.AI、cs.LG

AI总结 本研究针对蛋白质结构预测模型的专家预算约束,通过基准测试FK-steering、DPO、Best K-of-N采样及O3方法,明确不同预算下的最优方法并给出实用选择建议。

Comments Proceedings of the ICML 2026 Workshop on Structured Probabilistic Inference & Generative Modeling (SPIGM)

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.16169 2026-08-04 cs.LG cs.AI 版本更新 62%

When Does Muon Help Agentic Reinforcement Learning?

μ子何时有助于智能体强化学习?

Kai Ruan, Jinghao Lin, Zihe Huang, Ziqi Zhou, Qianshan Wei, Xuan Wang, Hao Sun

专题命中 后训练与偏好优化 :post-training(abstract);分类 cs.AI、cs.LG

AI总结 研究μ子在稀疏奖励智能体强化学习中的作用,通过与AdamW对比,发现在组内组策略优化下,μ子应用于隐藏权重矩阵能提升成功率,效果与优势估计器、学习率有关,表明其可使智能体RL受益,还需多种子和跨任务验证。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.30789 2026-07-27 cs.LG cs.AI 版本更新 62%

Smaller Models are Natural Explorers for Policy-Level Diversity in GRPO

小型模型是GRPO中策略级多样性的自然探索者

Yiran Xu, Yiming Ren, Zicheng Lin, Chufan Shi, Yukang Chen, Dingdong Wang, Tianhe Wu, Junjie Wang, Yujiu Yang, Yu Qiao, Ruihang Chu

机构 * University of Science and Technology of China(中国科学技术大学)

专题命中 后训练与偏好优化 :LLM(abstract_cn);分类 cs.AI、cs.LG

AI总结 提出S2L-PO框架,利用小型模型作为自然探索者生成策略级多样性的rollout,通过渐进退火策略过渡到大型模型自身采样,提升数学推理性能并减少计算开销。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.19313 2026-07-24 cs.RO cs.AI cs.LG 版本更新 62%

TOPReward: Token Probabilities as Hidden Zero-Shot Rewards for Robotics

TOPReward: 令牌概率作为机器人学中的隐式零样本奖励

Shirui Chen, Cole Harrison, Ying-Chun Lee, Angela Jin Yang, Zhongzheng Ren, Lillian J. Ratliff, Jiafei Duan, Dieter Fox, Ranjay Krishna

机构 * University of Washington(华盛顿大学) Allen Institute for AI(人工智能研究所) Amazon(亚马逊) University of North Carolina at Chapel Hill(北卡罗来纳大学教堂山分校)

专题命中 后训练与偏好优化 :language model(abstract);分类 cs.AI、cs.LG

AI总结 TOPReward通过利用预训练视频视觉-语言模型的令牌概率,提供高效的零样本奖励估计,显著提升机器人任务进度评估的性能和泛化能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.16051 2026-07-21 cs.CL cs.AI 版本更新 62%

Loop the Loopies!

循环循环者!

Zitian Gao, Yilong Chen, Yihao Xiao, Xinyu Yang, Ran Tao, Joey Zhou, Bryan Dai

专题命中 后训练与偏好优化 :post-training(abstract);分类 cs.CL、cs.AI

AI总结 研究提出最强大的循环Transformer——Loopie,由两个专家混合模型组成。它应对了循环Transformer面临的挑战,经消融研究表明在相同计算预算下优于普通基线,其训练后管道赋予强大推理能力,在竞赛中无需工具获金牌。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.08056 2026-07-10 cs.LG cs.AI stat.ML 新提交 62%

Reinforcing the Generation Order of Multimodal Masked Diffusion Models

强化多模态掩码扩散模型的生成顺序

Yidong Ouyang, Zhe Wang, Sourav Bhabesh, Dmitriy Bespalov

机构 * University of California, Los Angeles(加州大学洛杉矶分校) AGI Foundations for AWS(AWS强化人工智能基础)

专题命中 后训练与偏好优化 :language model(abstract);分类 cs.AI、cs.LG

AI总结 研究文本到图像合成及多模态理解中生成顺序的优化,引入经组相对策略优化训练的可学习控制模块,提升了DLMs的文本到图像对齐和多模态理解能力,在相关基准测试中取得显著改进。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.06609 2026-07-09 cs.LG cs.AI 新提交 62%

D2PO: Optimizing Diffusion Samplers via Dynamic Preference

D2PO:通过动态偏好优化扩散采样器

Jinkyu Kim, Jinyoung Choi, Bohyung Han

机构 * Seoul National University(首尔国立大学) Ulsan National Institute of Science and Technology(蔚山国立科学技术院)

专题命中 后训练与偏好优化 :preference optimization(abstract);分类 cs.AI、cs.LG

AI总结 研究针对现有框架局限,提出D2PO框架优化扩散采样策略。核心方法是将其转化为基于偏好的对齐问题,利用DPO框架并建模为能量模型,引入新能量公式和动态偏好。主要贡献是使采样器与感知质量更忠实对齐,性能优于传统调度器。

Comments Accepted to ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.03453 2026-07-07 cs.LG cs.AI 新提交 62%

Best-of-Better-$N$: Generating Pre-Aligned Responses with In-Context Learning

最佳中的更优N:通过上下文学习生成预对齐响应

Eric Lei, Hsiang Hsu, Chun-Fu Chen

机构 * JPMorganChase Global Technology Applied Research(摩根大通全球技术应用研究)

专题命中 后训练与偏好优化 :LLM(abstract);分类 cs.AI、cs.LG

AI总结 提出Best-of-Better-$N$框架应对响应质量限制问题,利用检索高奖励示例及重写步骤,通过上下文学习使预训练模型输出分布向高奖励区域转移,在安全对齐和数学推理基准测试中有更好表现。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.04531 2026-07-07 cs.LG cs.AI cs.NA eess.SP math.NA 新提交 62%

Lyapunov-Guided Training for Hardware-Safe Neural Networks Under Fixed-Point Arithmetic

定点运算下硬件安全神经网络的李雅普诺夫引导训练

Anis Hamadouche, Amir Hussain

机构 * The School of Engineering & Physical Sciences(工程与物理科学学院) SDAIA-KFUPM Joint Research Centre for Artificial Intelligence(SDAIA-KFUPM人工智能联合研究中心) Heriot-Watt University(赫瑞-沃森大学) King Fahd University of Petroleum and Minerals(国王法赫德石油大学)

专题命中 后训练与偏好优化 :post-training(abstract);分类 cs.AI、cs.LG

AI总结 针对定点运算中低精度神经网络的问题,提出李雅普诺夫稳定量化框架,通过层状李雅普诺夫函数监测隐藏状态能量,应用单调投影确保状态稳定,实验表明该方法可抑制激活溢出并恢复稳定学习。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.10494 2026-07-07 cs.CL cs.LG 版本更新 62%

Coverage-Controlled Preference Mining from Noisy Claim Verification for Evidence-Grounded Generation

基于噪声声明验证的覆盖控制偏好挖掘用于基于证据的生成

Weixin Liu, Congning Ni, Qingyuan Song, Susannah L. Rose, Murat Kantarcioglu, Bradley A. Malin, Zhijun Yin

机构 * Vanderbilt University(范德比大学) Vanderbilt University Medical Center(范德比大学医学中心) Lirio Virginia Tech(弗吉尼亚理工大学)

专题命中 后训练与偏好优化 :preference optimization(abstract);分类 cs.CL、cs.LG

AI总结 研究临床简要医院病程总结中基于证据生成的问题,引入VERI-DPO框架,将噪声声明验证转化为覆盖控制的摘要级偏好,经实验验证该框架能降低不支持率,提升模型表现。

Comments 15 pages, 1 figure, 8 tables. Major revision with locked MIMIC-IV transfer evaluation, blinded pairwise human assessment, matched multi-seed ablations, revised title, and revised author list

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.03955 2026-07-07 cs.LG cs.AI 版本更新 62%

GIPO: Gaussian Importance Sampling Policy Optimization

GIPO:高斯重要性采样策略优化

Chengxuan Lu, Zhenquan Zhang, Shukuan Wang, Qunzhi Lin, Baigui Sun, Yang Liu

机构 * University of Science and Technology of China(中国科学技术大学)

专题命中 后训练与偏好优化 :post-training(abstract);分类 cs.AI、cs.LG

AI总结 该研究提出了一种基于截断重要性采样的策略优化目标GIPO,通过使用基于对数比率的高斯信任权重替代硬裁剪,以软化极端重要性比率同时保持非零梯度,从而提高数据效率,实验表明GIPO在多种回放缓冲区大小下均取得最佳性能,表现出优越的偏差-方差权衡、高训练稳定性及改进的样本效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.11259 2026-07-07 cs.LG cs.AI 版本更新 62%

ICR-RL: Deep Reinforcement Learning via In-Context Regression

ICR-RL:通过上下文回归实现深度强化学习

David Schiff, Ofir Lindenbaum, Yonathan Efroni

机构 * Bar-Ilan University(巴伊兰大学) Tel Aviv University(特拉维夫大学)

专题命中 后训练与偏好优化 :foundation model(abstract);分类 cs.AI、cs.LG

AI总结 研究探索基于从强化学习到回归的经典简化的新方法,用预训练的回归基础模型作为上下文回归模型直接用于强化学习问题,引入无梯度方法ICR-RL,实验表明其能与常用方法竞争。

Comments Accepted to ICML 2026 Main Track

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.01897 2026-07-03 cs.LG cs.AI 新提交 62%

Rank-Then-Act: Reward-Free Control from Frame-Order Progress

先排序后行动:基于帧序进展的无奖励控制

Yuriy Maksyuta, George Bredis, Ruslan Rakhimov, Daniil Gavrilov

机构 * T-Tech

专题命中 后训练与偏好优化 :language model(abstract);分类 cs.AI、cs.LG

AI总结 提出Rank-Then-Act框架,利用视觉语言模型从专家视频中学习进度排序器,通过斯皮尔曼等级相关奖励函数实现无环境奖励的策略学习,在离散和连续控制任务中达到或超越现有方法。

Comments 20 pages, 15 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.00535 2026-07-02 cs.LG cs.AI cs.CV 新提交 62%

Flow-Map GRPO: Reinforcement Learning for Few-Step Flow-Map Generators via Anchored Stochastic Composition

Flow-Map GRPO:基于锚定随机组合的少步流映射生成器的强化学习

Zhiqi Li, Wen Zhang, Bo Zhu

机构 * Georgia Institute of Technology(佐治亚理工学院)

专题命中 后训练与偏好优化 :post-training(abstract);分类 cs.AI、cs.LG

AI总结 提出Flow-Map GRPO框架,通过锚定随机流映射组合(ASFMC)对确定性少步流映射生成器进行随机化,使其适用于强化学习后训练,并在FLUX文本到图像生成器上提升奖励和感知指标。

Comments 31 pages, 29 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.01179 2026-07-02 cs.LG cs.CL 新提交 62%

QuasiMoTTo: Quasi-Monte Carlo Test-Time Scaling

QuasiMoTTo: 准蒙特卡洛测试时扩展

Michael Y. Li, Anthony Zhan, Kanishk Gandhi, Noah D. Goodman, Emily B. Fox

机构 * Stanford University(斯坦福大学)

专题命中 后训练与偏好优化 :language model(abstract);分类 cs.CL、cs.LG

AI总结 提出QuasiMoTTo方法,利用准蒙特卡洛相关采样替代独立同分布采样,在推理和强化学习中减少冗余,以更少样本达到相同性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.17917 2026-07-01 cs.LG cs.AI cs.CR 版本更新 62%

Not Every Time and Frequency Need to Be Forgotten in Diffusion Unlearning

并非所有时间和频率都需要在扩散遗忘中被遗忘

Jinseong Park, Mijung Park

机构 * Korea Institute for Advanced Study(韩国高等研究院) University of British Columbia(不列颠哥伦比亚大学)

专题命中 后训练与偏好优化 :preference optimization(abstract);分类 cs.AI、cs.LG

AI总结 提出选择性遗忘扩散模型中的时间和频率,通过理论分析分布失真与遗忘-效用权衡,在多种设置下实现更高遗忘成功率和生成质量。

Comments ICML 2026 Workshop FoGen

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.28347 2026-06-30 cs.CY cs.AI cs.LG 62%

Agentic Safety is an Epistemic Property, Not a Behavioral One

智能体安全是认知属性,而非行为属性

Charles L. Wang, Keir Dorchen, Peter Jin

专题命中 后训练与偏好优化 :post-training(abstract);分类 cs.AI、cs.LG

AI总结 本文提出AI安全应视为认知属性,强调系统需保持可教性(teachability),即在学习、适应和自修改过程中仍能被纠正。

Comments To appear in proceedings of ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.26360 2026-06-29 cs.LG cs.AI 版本更新 62%

Uncertainty-Aware Reward Discounting for Mitigating Reward Hacking

考虑不确定性的奖励折扣以缓解奖励黑客

Disha Singha

专题命中 后训练与偏好优化 :RLHF(abstract);分类 cs.AI、cs.LG

AI总结 本文提出一种双源不确定性-aware奖励框架,通过建模价值估计和人类偏好中的不确定性,减少奖励黑客行为,在多个离散和连续控制环境中验证了其有效性。

Comments 46 pages, 16 figures, 6 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.07295 2026-06-26 cs.CV cs.AI cs.LG 版本更新 62%

Reconstruction Alignment Improves Unified Multimodal Models

重建对齐改进统一多模态模型

Ji Xie, Trevor Darrell, Luke Zettlemoyer, XuDong Wang

机构 * UC Berkeley(加州大学伯克利分校) University of Washington(华盛顿大学) Duke University(杜克大学)

专题命中 后训练与偏好优化 :post-training(abstract);分类 cs.AI、cs.LG

AI总结 提出重建对齐(RECA),一种资源高效的后训练方法,利用视觉理解编码器嵌入作为密集文本提示,通过自监督重建损失对齐理解与生成,显著提升多种统一多模态模型的生成和编辑性能。

Comments 43 pages, 36 figures and 14 tables; accepted by ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.25451 2026-06-25 cs.LG cs.AI 新提交 62%

Learning with a Single Rollout via Monte Carlo Pass@k Critic

通过蒙特卡洛 Pass@k 评判器进行单次 rollout 学习

Fengdi Che, Yang Liu, Lei Yu, Meng Cao, Tong Che, Rupam Mahmood, Dale Schuurmans

机构 * University of Alberta(阿尔伯塔大学) BIGAI(北京通用人工智能研究院) University of Toronto(多伦多大学) McGill University, Mila(麦吉尔大学,米拉) Nvidia Research(英伟达研究院) Amii(阿尔伯塔机器智能研究所) CIFAR AI Chair(CIFAR人工智能教席)

专题命中 后训练与偏好优化 :language model(abstract);分类 cs.AI、cs.LG

AI总结 提出单次 rollout 近端策略优化(SR-PPO),利用每个提示的一次 rollout 训练 token 级信用评判器,通过 Pass@k 成功概率提供更选择性学习信号,避免重复采样并改善信用分配。

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.09655 2026-06-16 cs.CL cs.LG 版本更新 62%

DRA-GRPO: Your GRPO Needs to Know Diverse Reasoning Paths for Mathematical Reasoning

DRA-GRPO:你的GRPO需要了解多样化的推理路径以进行数学推理

Xiwen Chen, Wenhui Zhu, Peijie Qiu, Xuanzhao Dong, Hao Wang, Haiyu Wu, Huayu Li, Aristeidis Sotiras, Yalin Wang, Abolfazl Razi

机构 * Morgan Stanley(摩根士丹利) Clemson University(克莱姆森大学) Arizona State University(亚利桑那州立大学) Washington University in St. Louis(圣路易斯华盛顿大学) University of Notre Dame(圣母大学) University of Arizona(亚利桑那大学)

专题命中 后训练与偏好优化 :post-training(abstract);分类 cs.CL、cs.LG

AI总结 针对GRPO在数学推理中因奖励信号非单射导致策略坍塌的问题,提出基于子模互信息的多样性感知奖励调整框架DRA,通过逆倾向评分去偏梯度估计,在五个数学基准上以少量数据和成本取得平均58.2%的准确率。

Comments ACL2026

详情

展开后加载摘要…

URL PDF HTML 收藏