arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

共收录 4541 信号源:cs.CL, cs.AI, cs.LG

1. 后训练与偏好优化 4541 篇

2605.04733 2026-06-05 cs.AI 57%

Reward-Decomposed Reinforcement Learning for Immersive Video Role-Playing

面向沉浸式视频角色扮演的奖励分解强化学习

Miao Wang, Yuling Shi, Yijiang Li, Yeheng Chen, Xiaodong Gu, Bin Li, Bo Gao, Jun Wang, Zengxin Han, Jingtong Wu, Yaduan Ruan

机构 * Nanjing University(南京大学) Shanghai Jiao Tong University(上海交通大学) University of California, San Diego(加州大学圣地亚哥分校) Shenzhen Institutes of Advanced Technology, Chinese Academy of Sciences(中国科学院深圳先进技术研究院) School of Information Engineering, Beijing Institute of Graphic Communication(北京印刷学院信息工程学院) Ant International, Ant Group(蚂蚁集团国际部) Independent Researcher(独立研究者)

专题命中 后训练与偏好优化 :language model(abstract);分类 cs.AI

AI总结 提出EBM-RL框架,通过奖励分解的强化学习优化视频角色扮演中的视觉感知、推理与生成过程,提升场景一致性与角色真实性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.09706 2026-06-05 cs.LG 57%

Training One Model to Master Cross-Level Agentic Actions via Reinforcement Learning

通过强化学习训练一个模型以掌握跨层级的代理行为

Kaichen He, Zihao Wang, Muyao Li, Anji Liu, Yitao Liang

机构 * Peking University(北京大学) National University of Singapore(新加坡国立大学)

专题命中 后训练与偏好优化 :post-training(abstract);分类 cs.LG

AI总结 本文提出CrossHA,一种统一的代理模型,能够掌握异构的动作空间并自主选择每一步轨迹中最有效的接口,通过结合冷启动监督微调和多轮组相对策略优化(GRPO)算法,实现适应性动作切换,在Minecraft开放世界中超过800个任务上展示了最先进的性能。

Comments Accepted to CVPR 2026 as a Highlight

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.22240 2026-06-04 cs.AI 57%

Unlocking Proactivity in Task-Oriented Dialogue

解锁任务导向型对话中的主动性

Azure Zhang, Ning Gao, Yuqin Dai, Ruiyuan Wu, Jinpeng Wang, Rena Wei Gao, Bingdong Tan, Shuzheng Gao, Zongjie Li, Chaozheng Wang

机构 * Keeta AI, Meituan(Keeta AI,美团) Independent Researcher(独立研究者) CUHK(香港中文大学) HKUST(香港科技大学)

专题命中 后训练与偏好优化 :LLM(abstract_cn);分类 cs.AI

AI总结 针对任务导向型对话中主动性问题,提出认知用户模拟器和模拟器诱导的非对称视角策略优化,通过建模用户潜在关注实现主动对话。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.19294 2026-06-04 cs.RO cs.AI 57%

DEFLECT: Temporal Counterfactual Preference Learning for Delay-Robust Asynchronous VLAs

DEFLECT: 面向延迟鲁棒异步VLA的时间反事实偏好学习

Yixiang Zhu, Yonghao Chen, Zijie Yang, Yusong Hu, Xinyu Chen

机构 * The Hong Kong University of Science and Technology (Guangzhou)(香港科学与技术大学(广州)) One Robotics

专题命中 后训练与偏好优化 :post-training(abstract);分类 cs.AI

AI总结 针对异步视觉-语言-动作(VLA)策略中陈旧观测导致的预测-执行不匹配问题,提出离线后训练框架DEFLECT,通过反事实偏好监督学习偏好与执行时间对齐的动作,无需人工标注、在线部署或架构修改,显著提升高延迟下的任务成功率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.03461 2026-06-03 cs.AI 57%

What Makes Interaction Trajectories Effective for Training Terminal Agents?

什么使得交互轨迹对训练终端代理有效?

Sidi Yang, Chaofan Tao, Jierun Chen, Tiezheng Yu, Ruoyu Wang, Yuxin Jiang, Yiming Du, Wendong Xu, Jing Xiong, Taiqiang Wu, Lifeng Shang, Xiaohui Li, Ngai Wong, Haoli Bai

机构 * The University of Hong Kong(香港大学) Huawei Technologies(华为技术有限公司) Nanyang Technological University(南洋理工大学)

专题命中 后训练与偏好优化 :post-training(abstract);分类 cs.AI

AI总结 本文通过Terminal-Lego流水线研究交互轨迹的教学效能,发现低分代理(DeepSeek-V3.2)的轨迹比高分代理(Claude Opus 4.6)更能提升学生泛化能力,归因于环境接地监督(EGS),并展示了极佳的数据效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.03094 2026-06-03 cs.LG 57%

FGRPO: Federated GRPO with Adaptive Aggregation on Non-IID Data

FGRPO:非独立同分布数据上具有自适应聚合的联邦GRPO

Pengyu Chen, Shaowei Li, Kai Wang, Yunsheng Yuan, Kai Han, Jun Luo, Feng Li

机构 * School of Computer Science and Technology, Shandong University(山东大学计算机科学与技术学院) School of Mathematical Science, Peking University(北京大学数学科学学院) School of Computer Science and Artificial Intelligence, Shanghai University of Finance and Economics(上海财经大学计算机科学与人工智能学院) College of Computing and Data Science, Nanyang Technological University(南洋理工大学计算与数据科学学院)

专题命中 后训练与偏好优化 :language model(abstract);分类 cs.LG

AI总结 提出联邦GRPO(FGRPO)框架,通过基于相对性能增益的自适应聚合机制,在非独立同分布数据上实现去中心化推理模型微调,兼顾数据隐私与鲁棒收敛。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.04899 2026-06-03 cs.CR cs.AI 57%

Phantom Transfer: Data Poisoning can Survive Data-Level Defences

幻影转移:数据投毒可存活于数据级防御

Andrew Draganov, Tolga H. Dur, Anandmayi Bhongade, Mary Phuong

专题命中 后训练与偏好优化 :post-training(abstract);分类 cs.AI

AI总结 提出一种名为“幻影转移”的数据投毒攻击,即使知道毒药如何被放入良性数据集也无法过滤,该攻击通过修改阈下学习以适应现实场景,并在多种数据级防御下存活。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.00938 2026-06-02 cs.CE cs.LG 57%

Machine Learning Surrogate Modeling for Homogenization of Hyperelastic Materials with Boolean Microstructures

具有布尔微结构的超弹性材料均匀化的机器学习代理建模

Matthias Brändel, Oliver Rheinbach

机构 * Technische Universität Bergakademie Freiberg(弗赖贝格应用科学大学)

专题命中 后训练与偏好优化 :post-training(abstract);分类 cs.LG

AI总结 提出一种监督学习方法,利用低维微观结构描述符(如面积分数、形状描述符τ、两点相关函数S2(r)和线路径函数ℓ(z))预测超弹性复合材料的有效拉梅参数,并通过留一法交叉验证评估泛化能力。

Comments 16 pages, 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.23500 2026-06-02 cs.CV cs.LG 57%

B-GRTO: Bootstrapped Group Relative Tool Optimization for Referring Segmentation

B-GRTO: 引导式分组相对工具优化用于指代分割

Mario Markov, Stefan Maria Ailuro, Mohammad Mahdi, Luc Van Gool, Danda Pani Paudel

机构 * INSAIT Sofia University "St. Kliment Ohridski"(索菲亚大学"圣克莱门特·欧赫里迪斯基")

专题命中 后训练与偏好优化 :language model(abstract);分类 cs.LG

AI总结 提出B-GRTO框架,通过引导式预训练和分组相对工具优化,联合优化策略与可微分割解码器,显著提升复杂指代分割性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.18373 2026-06-02 cs.CV cs.AI 57%

To See or To Please: Uncovering Visual Sycophancy and Split Beliefs in VLMs

看见还是取悦:揭示视觉语言模型中的视觉谄媚与分裂信念

Rui Hong, Shuxue Quan

机构 * George Mason University(乔治·玛斯纳大学) Independent Researcher(独立研究者)

专题命中 后训练与偏好优化 :post-training(abstract);分类 cs.AI

AI总结 提出三层诊断框架,通过反事实干预实验发现视觉语言模型中普遍存在视觉谄媚(内部证据保留但输出幻觉答案)现象,并证明扩展模型规模无法解决该问题。

Comments 14 pages, 1 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.00753 2026-06-02 math.OC cs.LG 57%

Mirror Descent Under Generalized Smoothness

广义光滑性下的镜像下降

Dingzhi Yu, Wei Jiang, Hongyi Tao, Yuanyu Wan, Lijun Zhang

机构 * State Key Laboratory of Novel Software Technology, Nanjing University(南京大学新型软件技术国家重点实验室) School of Artificial Intelligence, Nanjing University(南京大学人工智能学院) School of Computer Science and Engineering, Nanjing University of Science and Technology(南京理工大学计算机科学与工程学院) School of Software Technology, Zhejiang University(浙江大学软件技术学院) Hangzhou High-Tech Zone (Binjiang) Institute of Blockchain and Data Security(杭州高新技术区(滨江)区块链与数据安全研究院)

专题命中 后训练与偏好优化 :post-training(abstract);分类 cs.LG

AI总结 本文提出一种新的 $\ell_*$-光滑性概念,将经典光滑性推广到一般范数空间,并证明镜像下降类算法在此条件下收敛率与经典光滑性一致。

Comments ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.31433 2026-06-01 cs.CL 57%

SCOPE: Self-Play via Co-Evolving Policies for Open-Ended Tasks

SCOPE:面向开放式任务的协同演化策略自我对弈

Wai-Chung Kwan, Aryo Pradipta Gema, Joshua Ong Jun Leang, Pasquale Minervini

机构 * University of Edinburgh(爱丁堡大学) Imperial College London(伦敦帝国学院)

专题命中 后训练与偏好优化 :language model(abstract);分类 cs.CL

AI总结 提出SCOPE框架,通过协同演化挑战者和求解者策略,实现无数据自我对弈,在开放式任务上提升性能并超越依赖人工提示的方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.11723 2026-05-29 cs.CV cs.AI 57%

CaC: Advancing Video Reward Models via Hierarchical Spatiotemporal Concentrating

CaC:通过分层时空聚焦推进视频奖励模型

Jiyuan Wang, Huan Ouyang, Jiuzhou Lin, Chunyu Lin, Dewen Fan, Boheng Zhang, Haonan Fan, Fei Zuo, Jia Sun, Huaiqing Wang, Honglie Wang, Yiyang Fan, Zhenlong Yuan, Zijun Li, Yongrui Heng, Guosheng Lin, Fan Yang, Tingting Gao

机构 * BJTU(北京工业大学) NTU(国立台湾大学) BUPT(北京邮电大学) Kuaishou Technology(快手科技)

专题命中 后训练与偏好优化 :language model(abstract);分类 cs.AI

AI总结 提出基于视觉语言模型的粗到细异常奖励模型CaC,通过全局时间扫描、局部空间定位和结构化时空思维链推理,结合大规模生成视频异常数据集和三阶段渐进训练,显著提升细粒度异常检测精度并减少生成视频异常。

Comments 27 pages, 10 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.18518 2026-05-29 cs.CV cs.LG 57%

UDM-GRPO: Stable and Efficient Group Relative Policy Optimization for Uniform Discrete Diffusion Models

UDM-GRPO:面向均匀离散扩散模型的稳定高效组相对策略优化

Jiaqi Wang, Haoge Deng, Ting Pan, Yang Liu, Chengyuan Wang, Fan Zhang, Yonggang Qi, Xinlong Wang

机构 * Beijing University of Posts(北京邮电大学) Beijing Academy of Artificial Intelligence(北京人工智能研究院)

专题命中 后训练与偏好优化 :pretraining(abstract);分类 cs.LG

AI总结 针对均匀离散扩散模型(UDM)与强化学习(RL)集成时训练不稳定、性能提升有限的问题,提出UDM-GRPO框架,通过将最终干净样本作为动作、利用扩散前向过程重建轨迹以及引入简化步数和无CFG策略,显著提升文本到图像生成任务的性能。

Comments UDM-GRPO is accepted by ICML 2026 (Spotlight). Code is available at https://github.com/Yovecent/UDM-GRPO

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.27969 2026-05-28 cs.CL 57%

Boundary Suppression Asymmetry in Post-trained Assistants: Over-expansion as a Controllability Cost

后训练助手中的边界抑制不对称性:过度扩展作为可控性代价

Jiarui Han

专题命中 后训练与偏好优化 :post-training(abstract);分类 cs.CL

AI总结 研究后训练语言模型助手中因避免回答不足而导致的边界抑制不对称性,发现反回答不足策略在边界控制评估中更难被抑制,且这种代价与内容预算超支和延续持续性相关。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.27117 2026-05-27 cs.AI 57%

Position: AI Safety Requires Effective Controllability

立场:AI安全需要有效可控性

Yige Li, Yunhao Feng, Jun Sun

机构 * Singapore Management University(新加坡管理大学) Ant Group(蚂蚁集团)

专题命中 后训练与偏好优化 :language model(abstract);分类 cs.AI

AI总结 本文提出AI安全应将可控性作为首要目标,通过定义可控性、引入基准测试ControlBench并分析现有对齐机制的不足,提出以控制为中心的架构框架。

Comments 23 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.25347 2026-05-26 cs.CV cs.LG 57%

ERNIE-Image Technical Report

ERNIE-Image 技术报告

Jiaxiang Liu, Zhida Feng, Pengyu Zou, Zhenyu Qian, Tianrui Zhu, Jun Xia, Yuehu Dong, Yanzheng Lin, Honglin Xiong, Anqi Chen, Yunpeng Ding, Jinghui Duan, Lin Gao, Chao Han, Tiechao He, Jiakang Hu, Ranjun Hua, Xueming Jiang, Qingli Kong, Yuting Lei, Tianyu Li, Yunlin Liu, Changling Liu, Yaxin Liu, Yi Liu, Xuguang Liu, Xiaolong Ma, Yan Pan, Yiran Ren, Nan Sheng, Yu Sun, Siyang Sun, Yixiang Tu, Yang Wan, Huanai Wang, Siqi Wang, Yang Wu, Youzhi Yang, Xiaowen Yang, Jianwen Yang, Yehua Yang, Quanwen Zhang, Xinmin Zhang, Haoxin Zhang, Xiang Zhang, Jun Zhang, Qian Zhang, Qiao Zhao, Qi Zhou

机构 * ERNIE Team, Baidu(百度ERNIE团队)

专题命中 后训练与偏好优化 :post-training(abstract);分类 cs.LG

AI总结 提出基于8B单流DiT架构的开源文本到图像生成模型ERNIE-Image,通过自底向上的预训练数据构建和自顶向下的后训练数据构建,结合稳定DPO策略和MT-DMD蒸馏方法,在指令遵循、文本渲染和美学质量上接近顶级商业模型。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.21652 2026-05-26 cs.CV cs.AI 57%

Look-Closer-Then-Diagnose: Confidence-Aware Ultrasound VQA via Active Zooming

Look-Closer-Then-Diagnose: 通过主动缩放实现置信度感知的超声VQA

Yue Zhou, Erxuan Wu, Yikang Sun, Hongjoo Lee, Yuan Bi, Huixiong Xu, Nassir Navab, Zhongliang Jiang

机构 * Computer Aided Medical Procedures (CAMP)(计算机辅助医疗程序) TU Munich, Germany(慕尼黑工业大学,德国) Munich Center for Machine Learning (MCML)(慕尼黑机器学习中心) Munich, Germany(慕尼黑,德国) Zhongshan Hospital, Fudan University, China(复旦大学中山医院) The University of Hong Kong, Hongkong, China(香港大学,香港,中国)

专题命中 后训练与偏好优化 :language model(abstract);分类 cs.AI

AI总结 提出一个模拟超声医师认知流程的框架,通过“缩放-诊断”范式和基于组相对策略优化的不确定性感知奖励,提升超声视觉问答中病灶定位和诊断性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.24229 2026-05-26 cs.AI 57%

How Well Do Models Follow Their Constitutions?

模型遵循其宪法的程度如何?

Arya Jakkli, Senthooran Rajamanoharan, Neel Nanda

机构 * Anthropic

专题命中 后训练与偏好优化 :post-training(abstract);分类 cs.AI

AI总结 提出多方法审计流程,评估前沿AI模型在对抗性多轮交互中遵循其书面行为规范(如Anthropic宪法和OpenAI模型规范)的程度,发现新一代模型违规率显著下降。

Comments 37 pages including appendix. Code, tenet lists, and full transcripts: https://github.com/ajobi-uhc/constitution-audits. Companion blog post on LessWrong/AI Alignment Forum: https://www.lesswrong.com/posts/Tk4SF8qFdMrzGJGGw/how-well-do-models-follow-their-constitutions

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.22703 2026-05-22 cs.LG 57%

Clipping Bottleneck: Stabilizing RLVR via Stochastic Recovery of Near-Boundary Signals

剪裁瓶颈:通过近边界信号的随机恢复稳定RLVR

Shuo Yang, Jinda Lu, Chiyu Ma, Kexin Huang, Haoming Meng, Qihui Zhang, Yuyang Liu, Bolin Ding, Guoyin Wang, Li Yuan, Jingren Zhou

机构 * Alibaba Group(阿里巴巴集团)

专题命中 后训练与偏好优化 :LLM(abstract);分类 cs.LG

AI总结 本文研究了强化学习可验证奖励(RLVR)中由于硬剪裁决策导致的训练不稳定问题,提出了一种名为近边界随机救援(NSR)的简单方法,通过随机保留略微超出边界范围的token来恢复丢失的信号,从而提升训练稳定性和性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.20277 2026-05-21 cs.CV cs.AI 57%

Regulating Anatomy-Aware Rewards via Trajectory-Integral Feedback for Volumetric Computed Tomography Analysis

通过轨迹积分反馈调节解剖感知奖励用于体积计算断层扫描分析

Tianwei Lin, Zhongwei Qiu, Jie Cao, Jiang Liu, Wenjie Yan, Bo Zhang, Yu Zhong, Wenqiao Zhang, Yingda Xia, Ling Zhang

机构 * Zhejiang University(浙江大学) DAMO Academy, Alibaba Group(阿里集团达摩院) Hupan Lab(虎扑实验室) University of Electronic Science and Technology of China(电子科技大学)

专题命中 后训练与偏好优化 :language model(abstract);分类 cs.AI

AI总结 本文提出了一种新的框架,通过轨迹积分反馈GRPO(TIF-GRPO)来改进医疗视觉语言模型在三维CT分析中的性能,通过引入临床异常基准评估子系统(CABS)来解决优化目标与临床严谨性之间的不匹配问题,提升异常检测和临床准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.20164 2026-05-20 cs.AI 57%

Not Every Rubric Teaches Equally: Policy-Aware Rubric Rewards for RLVR

并非每个评分标准都等同教学:面向RLVR的政策感知评分奖励

Utkarsh Tyagi, Xingang Guo, MohammadHossein Rezaei, Daniel George, Anas Mahmoud, Jackson Lee, Bing Liu, Yunzhong He

机构 * Scale AI

专题命中 后训练与偏好优化 :post-training(abstract);分类 cs.AI

AI总结 本文提出POW3R框架,通过保留人类权重和类别平衡,改进评分奖励机制,使评分标准更符合最终答案的要求,从而在多模态和纯文本设置中提升性能。

Comments 24 pages, 7 figures, 6 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.20066 2026-05-20 cs.CL 57%

Text-to-SPARQL Generation with Reinforcement Learning: A GRPO-based Approach on DBLP

基于强化学习的文本到SPARQL生成:在DBLP上的GRPO方法

Jann Pfeifer, Debayan Banerjee, Ricardo Usbeck

专题命中 后训练与偏好优化 :language model(abstract);分类 cs.CL

AI总结 本文研究了在学术领域中,基于强化学习的零样本文本到SPARQL生成方法,通过GRPO算法在DBLP-QuAD上训练小型指令微调语言模型,并与监督学习的DoRA微调基线进行比较。

Comments Accepted by NeSy 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.19577 2026-05-20 cs.CL 57%

GoLongRL: Capability-Oriented Long Context Reinforcement Learning with Multitask Alignment

GoLongRL: 以能力为导向的长上下文强化学习与多任务对齐

Minxuan Lv, Tiehua Mei, Tanlong Du, Junmin Chen, Zhenpeng Su, Ziyang Chen, Ziqi Wang, Zhennan Wu, Ruotong Pan, jian Liang, Ruiming Tang, Han Li

机构 * Kuaishou Technology(快手科技) University of Chinese Academy of Sciences(中国科学院大学)

专题命中 后训练与偏好优化 :post-training(abstract);分类 cs.CL

AI总结 本文提出GoLongRL,一种完全开源的、以能力为导向的长上下文强化学习后训练配方,通过可验证奖励(RLVR)实现。现有长上下文强化学习方法往往将数据构建视为设计越来越复杂的检索路径,导致任务覆盖同质化和奖励形式无法充分反映实际长上下文需求。本文的贡献是(1)以能力为导向的数据构建并完全开源,释放了包含23,000个RLVR样本的数据集、完整的构建流程和所有训练代码。基于长上下文能力的分类学,数据集涵盖9种任务类型,每种任务类型都配有其自然评估指标。它包含从现有语料库中精心挑选的开源样本和合成样本,其问答对是从真实源文档如书籍、学术论文和多轮对话中生成的。在相同的 vanilla GRPO 设置下,我们的数据集单独优于闭源的 QwenLong-L1.5 数据集。此外,我们的 Qwen3-30B-A3B 模型在该数据上训练后,长上下文性能与 DeepSeek-R1-0528 和 Qwen3-235B-A22B-Thinking-2507 相当,表明更广泛的覆盖和更大的奖励多样性显著有助于长上下文能力的提升。(2)TMN-Reweight 用于异构多任务优化。为了解决异构奖励带来的优化挑战,我们提出了 TMN-Reweight,它结合了任务层面的均值归一化以实现跨任务奖励尺度对齐,以及难度自适应加权以获得更可靠的优势估计。TMN-Reweight 进一步在 vanilla GRPO 上提高了平均性能,在报告的评估中,通用能力得以保持或提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.16515 2026-05-19 cs.CV cs.LG 57%

SeamCam: Quantifying Seamless Camouflage via Multi-Cue Visual Detectability

SeamCam:通过多线索视觉可探测性量化无缝伪装

Amin Karimi Monsefi, Abolfazl Meyarian, Mridul Khurana, Shuheng Wang, Pouyan Navard, Cheng Zhang, Anuj Karpatne, Wei-Lun Chao, Rajiv Ramnath

机构 * The Ohio State University(俄亥俄州立大学) Path Robotics, USA(Path Robotics公司) Virginia Tech(弗吉尼亚理工大学) Boston University(波士顿大学)

专题命中 后训练与偏好优化 :preference optimization(abstract);分类 cs.LG

AI总结 SeamCam通过将伪装评估转化为视觉定位问题,提出了一种量化动物伪装效果的指标,通过人类实验验证其有效性,并展示了其在扩散模型训练中的应用。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.16381 2026-05-19 cs.CV cs.AI 57%

StreamPro: From Reactive Perception to Proactive Decision-Making in Streaming Video

StreamPro: 从反应式感知到主动决策的流视频处理

Ao Li, Zihan Xiao, Zihao Yue, Boshen Xu, Linli Yao, Jiaze Li, Pei Fu, Jianzhong Ju, Jian Luan, Qin Jin

机构 * AIM3 Lab, Renmin University of China(中国人民大学AIM3实验室) MiLM Plus, Xiaomi Inc.(小米公司MiLM Plus)

专题命中 后训练与偏好优化 :SFT(abstract);分类 cs.AI

AI总结 StreamPro通过引入CB-Stream损失和GRPO算法,提升流视频处理的主动决策能力,在StreamPro-Bench上取得显著成效,性能优于先前最佳。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.16154 2026-05-18 cs.LG cs.RO 57%

Learn Where Outcomes Diverge: Efficient VLA RL via Probabilistic Chunk Masking

学习结果分歧之处:通过概率块掩码实现高效的VLA强化学习

Vaidehi Bagaria, Nikshep Grampurohit, Pulkit Verma

机构 * Indian Institute of Technology Madras(印度理工学院马德拉斯学院)

专题命中 后训练与偏好优化 :post-training(abstract);分类 cs.LG

AI总结 本文提出概率块掩码(PCM),通过选择性分配梯度计算来提升GRPO-based VLA RL的效率,实现更快的训练速度和更低的内存消耗。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.14269 2026-05-15 cs.CV cs.AI 57%

PhyMotion: Structured 3D Motion Reward for Physics-Grounded Human Video Generation

PhyMotion: 结构化3D运动奖励用于物理基础的人体视频生成

Yidong Huang, Zun Wang, Han Lin, Dong-Ki Kim, Shayegan Omidshafiei, Jaehong Yoon, Jaemin Cho, Yue Zhang, Mohit Bansal

机构 * UNC Chapel Hill(UNC夏洛特希尔大学) FieldAI NTU Singapore(新加坡国立大学) AI2 Johns Hopkins University(约翰霍普金斯大学)

专题命中 后训练与偏好优化 :post-training(abstract);分类 cs.AI

AI总结 本文提出PhyMotion,一种结构化的3D运动奖励机制,通过物理模拟器评估人体运动的物理可行性,提升视频生成中人体动作的真实感。

Comments First two authors contributed equally, website: https://phy-motion.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.25240 2026-05-15 stat.ML cs.LG 57%

Generative Bayesian Optimization: Generative Models as Acquisition Functions

生成贝叶斯优化:生成模型作为获取函数

Rafael Oliveira, Daniel M. Steinberg, Edwin V. Bonilla

机构 * CSIRO’s Data61(CSIRO的数据61)

专题命中 后训练与偏好优化 :preference optimization(abstract);分类 cs.LG

AI总结 本文提出利用生成模型作为批量贝叶斯优化的候选解采样器,通过直接优化偏好信号生成高效的获取函数,适用于高维和组合优化问题。

Comments Published at ICLR 2026. Compared with the proceedings version on OpenReview, this version includes a minor revision to Section 3

Journal ref The Fourteenth International Conference on Learning Representations (ICLR 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.09923 2026-05-14 cs.AI 57%

expo: Exploration-prioritized policy optimization via adaptive kl regulation and gaussian curriculum sampling

expo: 通过自适应KL调节和高斯课程采样优先政策优化

Mingxiong Lin, Zhangquan Gong, Maowen Tang, Qian Li, Chuangchuang Wang, Jian Ma, Sutian Huang, Kai Tang, Haonan Lu

专题命中 后训练与偏好优化 :LLM(abstract);分类 cs.AI

AI总结 本文提出EXPO算法,通过自适应KL调节和高斯课程采样提升策略探索效率,实验表明其在数学推理任务中显著优于传统GRPO方法。

Comments Duplicate submission of arXiv:2605.11403

详情

展开后加载摘要…

URL PDF HTML 收藏