arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型推理能力

大模型数学、逻辑、规划、多步推理和测试时计算能力。

共收录 45417 信号源:cs.CL, cs.AI, cs.LG

1. 数学推理 3252 篇

2605.29398 2026-05-29 cs.LG cs.AI 62%

GDSD: Reinforcement Learning as Guided Denoiser Self-Distillation for Diffusion Language Models

GDSD:强化学习作为扩散语言模型的引导去噪器自蒸馏

Xiaohang Tang, Keyue Jiang, Che Liu, Qifang Zhao, Xiaoxiao Xu, Sangwoong Yoon, Ilija Bogunovic

机构 * UCL Dept. of Statistical Science(伦敦大学学院统计科学系) UCL Centre for AI(伦敦大学学院人工智能中心) Alibaba Group(阿里巴巴集团) Dept. of EEE(电子工程系) Imperial College London(伦敦帝国理工学院) UNIST(全南大学) University of Basel(巴塞尔大学)

专题命中 数学推理 :planning(abstract);分类 cs.AI、cs.LG

AI总结 提出引导去噪器自蒸馏(GDSD)方法,通过从逆KL正则化强化学习的闭式最优解中导出的优势引导自教师直接蒸馏扩散语言模型的去噪器,避免了ELBO似然代理带来的训练-推理不匹配偏差,在规划、数学和代码基准上显著优于现有方法。

Comments Preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.29089 2026-05-29 cs.LG cs.AI cs.CV 62%

OISD: On-Policy Internal Self-Distillation of Language Models

OISD: 语言模型在策略内部自蒸馏

Xinyu Liu, Darryl Cherian Jacob, Yang Zhou, Jindong Wang, Pan He

机构 * Auburn University(阿肯色大学) William & Mary(威廉与玛丽学院)

专题命中 数学推理 :reasoning(abstract);分类 cs.AI、cs.LG

AI总结 提出OISD框架,通过将最终层的预测信号蒸馏到中间层,结合logit对齐和注意力对齐,提升推理能力,在数学推理任务上显著优于基线。

Comments Under Review for Publication

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.21725 2026-05-29 cs.CL cs.LG 62%

Procedural Pretraining: Warming Up Language Models with Abstract Data

程序化预训练:用抽象数据预热语言模型

Liangze Jiang, Zachary Shinnick, Anton van den Hengel, Hemanth Saratchandran, Damien Teney

机构 * EPFL(苏黎世联邦理工学院) Idiap Research Institute(伊迪普研究机构) AIML, Adelaide University(人工智能实验室,阿德莱德大学)

专题命中 数学推理 :reasoning(abstract);分类 cs.CL、cs.LG

AI总结 提出程序化预训练方法,通过在抽象结构化数据(如形式语言生成的程序数据)上预训练语言模型,显著提升其推理能力并加速后续语义知识学习,实验表明仅需0.1-0.3%的程序数据即可超越标准预训练。

Comments ICML 2026. Project page: https://zlshinnick.github.io/procedural-pretraining-page/

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.27788 2026-05-28 cs.LG cs.CL 62%

Knowing When to Ask: Segment-Level Credit Assignment for LLM Tool Use

知道何时求助:面向LLM工具使用的片段级信用分配

Abhijit Kumar, Zoey Wu, Mohit Suley

机构 * Microsoft AI Redmond(微软AI红mond)

专题命中 数学推理 :reasoning(abstract);分类 cs.CL、cs.LG

AI总结 提出CARL方法,通过强化学习在模型自身轨迹上训练评论家,对每个工具使用片段独立分配信用,使模型学会区分参数知识足够与需要外部帮助的情况,在多个基准上提升准确率并减少不必要的工具调用。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.27088 2026-05-27 cs.CL cs.LG 62%

LLMs Are Already Good Tutors: Training-Free Prompt Optimization for Pedagogical Math Tutoring

LLMs 已经是好导师:面向教学数学辅导的无训练提示优化

Unggi Lee, Minchul Shin, Yeil Jeong, Sookbun Lee, Jeongsu Moon, Kyungtae Joo, Eunjoo Lee, Hoilym Kwon

机构 * Korea University Sejong Campus(韩国大学世宗校区) Gyeonggi Institute of Education(京畿教育学院) Indiana University Bloomington(印第安纳大学布卢明顿分校) Opentutorials Chosun University(全州大学) Korea University Korean Studies Center(韩国大学韩学研究中心)

专题命中 数学推理 :reasoning(abstract);分类 cs.CL、cs.LG

AI总结 本研究探索通过API调用优化系统提示的无训练方法,提出5种教育专用方法,在2个OOD基准上评估12种方法,发现所有方法均超越最强RL训练基线,ParetoGrad在事后解决率、泄漏控制和有用性上达到最佳帕累托平衡。

Comments 17 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.26842 2026-05-27 cs.LG cs.CL 62%

MONA: Muon Optimizer with Nesterov Acceleration for Scalable Language Model Training

MONA: 基于Nesterov加速的Muon优化器用于可扩展语言模型训练

Jiacheng Li, Jianchao Tan, Hongtao Xu, Jiaqi Zhang, Yifan Lu, Yerui Sun, Yuchen Xie, Xunliang Cai

机构 * Meituan(美团)

专题命中 数学推理 :reasoning(abstract);分类 cs.CL、cs.LG

AI总结 提出MONA优化器,通过将Nesterov加速项集成到Muon的梯度处理流程中,实现曲率感知加速,从而帮助逃离尖锐局部最小值,并在1B到68B参数的混合专家预训练中取得更优收敛和下游任务性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.26784 2026-05-27 cs.LG cs.AI 62%

Ratio-Variance Regularized Policy Optimization

比率方差正则化策略优化

Yu Luo, Shuo Han, Yihan Hu, Lei Lv, Huaping Liu, Fuchun Sun, Jianye Hao, Dong Li

机构 * Department of Foundation Model, 2012 Labs, Huawei(华为基础模型部门,2012实验室) Shanghai Research Institute for Intelligent Autonomous Systems, Tongji University(上海智能自主系统研究院,同济大学) Department of Computer Science and Technology, Tsinghua University(清华大学计算机科学与技术系) College of Intelligence and Computing, Tianjin University(天津大学智能与计算学院)

专题命中 数学推理 :reasoning(abstract);分类 cs.AI、cs.LG

AI总结 提出R²VPO方法,通过约束策略比率方差作为信任区域的局部近似,替代启发式裁剪,在LLM和机器人控制任务中提升性能与样本效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.26655 2026-05-27 cs.CL cs.LG cs.NE 62%

Why Prompt Optimization Works, and Why It Sometimes Doesn't: A Causal-Inspired Edit-Level Analysis

为什么提示优化有效,以及为什么有时无效:一种因果启发的编辑级分析

Shuzhi Gong, Hechuan Wen

机构 * The University of Melbourne(墨尔本大学) The University of Queensland(昆士兰大学)

专题命中 数学推理 :reasoning(abstract);分类 cs.CL、cs.LG

AI总结 本文通过因果推断方法分析自动提示优化在不同任务和模型上的泛化失败原因,发现编辑类型与任务特性之间的系统性交互作用。

Comments 17 pages, 4 figures, 8 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.07053 2026-05-27 cs.CL cs.AI 62%

GSM-SEM: Benchmark and Framework for Generating Semantically Variant Augmentations

GSM-SEM: 生成语义变体增强的基准与框架

Jyotika Singh, Fang Tu, Aziza Mirsaidova, Amit Agarwal, Hitesh Laxmichand Patel, Sandip Ghoshal, Miguel Ballesteros, Karan Dua, Yassine Benajiba, Weiyi Sun, Tao Sheng, Graham Horwood, Sujith Ravi, Dan Roth

机构 * Oracle AI

专题命中 数学推理 :reasoning(abstract);分类 cs.CL、cs.AI

AI总结 提出GSM-SEM框架,通过修改实体、属性和关系生成语义多样的数学问题变体,降低模型对固定测试集的记忆偏差,并在多个基准上验证性能下降。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.11056 2026-05-27 cs.LG cs.AI 62%

Where Hindsight Credit Can Reside: A Signed-Capacity View of Token Updates in RLVR

事后信用可驻留之处:RLVR中令牌更新的有符号容量视角

Yuhang He, Haodong Wu, Siyi Liu, Hongyu Ge, Hange Zhou, Keyi Wu, Zhuo Zheng, Qihong Lin, Zixin Zhong, Yongqi Zhang

机构 * The Hong Kong University of Science and Technology (Guangzhou)(香港科学与技术大学(广州)) Huawei Technologies Ltd.(华为技术有限公司)

专题命中 数学推理 :reasoning(abstract);分类 cs.AI、cs.LG

AI总结 本文通过条件互信息分析RLVR中令牌级信用的容量上限,提出四象限分解区分更新方向,并设计HAPO算法进行容量引导的优势重分配,提升数学推理性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.22648 2026-05-27 cs.AI cs.LG 62%

UCPO: Uncertainty-Aware Policy Optimization

UCPO:不确定性感知策略优化

Xianzhou Zeng, Jing Huang, Chunmei Xie, Gongrui Nan, Siye Chen, Mengyu Lu, Weiqi Xiong, Qixuan Zhou, Junhao Zhang, Qiang Zhu, Yadong Li, Xingzhong Xu

专题命中 数学推理 :reasoning(abstract);分类 cs.AI、cs.LG

AI总结 针对现有强化学习范式在不确定性奖励下存在的优势偏差和过度自信问题,提出三元优势解耦和动态不确定性奖励调整机制,显著提升模型在知识边界外的可靠性。

Comments Accepted by ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.25604 2026-05-26 cs.CL cs.LG 62%

DVAO: Dynamic Variance-adaptive Advantage Optimization for Multi-reward Reinforcement Learning

DVAO: 面向多奖励强化学习的动态方差自适应优势优化

Guochao Jiang, Jingyi Song, Guofeng Quan, Chuzhan Hao, Guohua Liu, Yuewei Zhang

机构 * Alibaba Cloud Computing(阿里巴巴云 computing)

专题命中 数学推理 :reasoning(abstract);分类 cs.CL、cs.LG

AI总结 针对多奖励强化学习中奖励组合导致训练不稳定、优势组合依赖静态超参数的问题,提出动态方差自适应优势优化方法,通过基于经验奖励方差动态调整组合权重,实现稳定训练与多目标帕累托前沿优化。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.25338 2026-05-26 cs.LG cs.AI 62%

CausalFlow: Causal Attribution and Counterfactual Repair for LLM Agent Failures

CausalFlow: LLM Agent 失败的因果归因与反事实修复

Akash Bonagiri, Devang Borkar, Gerard Janno Anderias, Setareh Rafatirad, Houman Homayoun

机构 * Department of Computer Science University of California, Davis(计算机科学系加州大学戴维斯分校)

专题命中 数学推理 :reasoning(abstract);分类 cs.AI、cs.LG

AI总结 提出CausalFlow框架,通过反事实干预计算步骤级因果责任分数,识别失败步骤并生成最小编辑修复,用于测试时修复和训练时监督,在多个基准上优于启发式方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.15620 2026-05-26 cs.CL cs.AI 62%

STAPO: Stabilizing Reinforcement Learning for LLMs by Silencing Rare Spurious Tokens

STAPO:通过抑制稀有虚假标记稳定大语言模型的强化学习

Shiqi Liu, Zeyu He, Guojian Zhan, Letian Tao, Zhilong Zheng, Jiang Wu, Yinuo Wang, Yang Guan, Kehua Sheng, Bo Zhang, Keqiang Li, Jingliang Duan, Shengbo Eben Li

机构 * School of Vehicle Mobility \& College of AI, Tsinghua University Didi Voyager Labs, DiDi Autonomous Driving

专题命中 数学推理 :reasoning(abstract);分类 cs.CL、cs.AI

AI总结 针对强化学习微调大语言模型时因稀有虚假标记导致训练不稳定和性能崩溃的问题,提出STAPO方法,通过抑制这些标记的梯度扰动,在多个数学推理基准上实现稳定训练和性能提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.08499 2026-05-26 cs.LG cs.AI 62%

Contextual Rollout Bandits for Reinforcement Learning with Verifiable Rewards

上下文展开赌博机:面向可验证奖励的强化学习

Xiaodong Lu, Xiaohan Wang, Jiajun Chai, Guojun Yin, Wei Lin, Zhijun Chen, Yu Luo, Fuzhen Zhuang, Yikun Ban, Deqing Wang

机构 * School of Computer Science and Engineering, Beihang University(北京航空航天大学计算机科学与工程学院) School of Artificial Intelligence, Beihang University(北京航空航天大学人工智能学院) Huawei(华为)

专题命中 数学推理 :reasoning(abstract);分类 cs.AI、cs.LG

AI总结 针对RLVR中展开使用无差别、短视导致的问题,提出上下文赌博机框架,自适应选择高价值展开,提升训练效率与性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.25189 2026-05-26 cs.LG cs.CL 62%

Directional Alignment Mitigates Reward Hacking in Reinforcement Learning for Language Models

方向对齐缓解语言模型强化学习中的奖励黑客问题

Wenlong Deng, Jiaji Huang, Kaan Ozkara, Yushu Li, Christos Thrampoulidis, Xiaoxiao Li, Youngsuk Park

机构 * University of British Columbia(不列颠哥伦比亚大学) Vector Institute(向量研究所) Amazon(亚马逊)

专题命中 数学推理 :reasoning(abstract);分类 cs.CL、cs.LG

AI总结 通过分析强化学习更新的几何结构,发现奖励黑客源于优化偏离稳定低维学习轨迹,提出可信方向投影方法约束梯度在干净参考子空间内,延迟捷径利用并保持任务性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.24697 2026-05-26 cs.CL cs.AI 62%

The Path Matters: Learning a Token-Commitment Policy for Diffusion Language Models

路径很重要:学习扩散语言模型的令牌提交策略

Bohang Sun, Max Zhu, Francesco Caso, Jindong Gu, Junchi Yu, Philip Torr, Pietro Liò, Jialin Yu

机构 * Department of Computer Science and Technology, University of Cambridge(计算机科学与技术系,剑桥大学) Department of Engineering Science, University of Oxford(工程科学系,牛津大学)

专题命中 数学推理 :reasoning(abstract);分类 cs.CL、cs.AI

AI总结 本文提出TraceLock,一种轻量级可插拔控制器,通过学习可复用的轨迹状态策略来优化扩散语言模型中的令牌提交决策,从而改善质量与步数之间的权衡。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.24168 2026-05-26 cs.AI cs.LG 62%

Inference Time Context Sparsity: Illusion or Opportunity?

推理时上下文稀疏性:幻觉还是机遇?

Sahil Joshi, Prithvi Dixit, Agniva Chowdhury, Anshumali Shrivastava, Joseph E. Gonzalez, Ion Stoica, Kumar Krishna Agrawal, Aditya Desai

机构 * Berkeley(伯克利)

专题命中 数学推理 :reasoning(abstract);分类 cs.AI、cs.LG

AI总结 本文通过实证和理论证据论证,在长上下文LLM推理中采用极端但原则性的上下文维度稀疏性不仅是可行的,而且能显著加速处理(如H100上实现10倍加速),从而挑战了密集注意力机制的必要性。

Comments 19 pages, 8 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.13088 2026-05-26 cs.LG cs.AI 62%

Design Conditions for Intra-Group Learning of Sequence-Level Rewards: Token Gradient Cancellation

序列级奖励的组内学习设计条件:令牌梯度消除

Fei Ding, Yongkang Zhang, youwei wang, Zijian Zeng

机构 * Alibaba Group(阿里巴巴集团) Tsinghua University(清华大学)

专题命中 数学推理 :reasoning(abstract);分类 cs.AI、cs.LG

AI总结 针对大语言模型多步推理中稀疏终端奖励导致的信用分配问题,提出反事实比较框架和隐式行为策略优化(IBPO),通过轨迹差异近似替代决策,将稀疏奖励转化为步骤敏感信号,提升训练稳定性和推理性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.19310 2026-05-25 cs.LG cs.AI 62%

MemReward: Graph-Based Experience Memory for LLM Reward Prediction with Limited Labels

MemReward: 基于图的经验记忆用于有限标签下的LLM奖励预测

Tianyang Luo, Tao Feng, Zhigang Hua, Yan Xie, Shuang Yang, Ge Liu, Jiaxuan You

机构 * University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) Meta

专题命中 数学推理 :reasoning(abstract);分类 cs.AI、cs.LG

AI总结 提出MemReward框架,利用图神经网络在少量标签下将奖励从标注样本传播到未标注样本,实现混合奖励获取策略,在数学、问答和代码生成任务上接近Oracle性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.22177 2026-05-22 cs.LG cs.CL 62%

Maestro: Reinforcement Learning to Orchestrate Hierarchical Model-Skill Ensembles

Maestro:通过强化学习协调分层模型-技能集合

Jinyang Wu, Guocheng Zhai, Ruihan Jin, Yuhao Shen, Zhengxi Lu, Fan Zhang, Haoran Luo, Zheng Lian, Zhengqi Wen, Jianhua Tao

机构 * Tsinghua University(清华大学) Zhejiang University(浙江大学) The Chinese University of Hong Kong(香港中文大学) Nanyang Technological University(南洋理工大学) Tongji University(同济大学)

专题命中 数学推理 :reasoning(abstract);分类 cs.CL、cs.LG

AI总结 本文提出Maestro框架,通过强化学习协调多模态任务,利用分层模型-技能集合提升多模态任务性能,实现高效且通用的协调策略。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.04537 2026-05-22 cs.LG cs.CL 62%

Linear Dynamics in the RLVR Training of Large Language Models

在大语言模型RLVR训练中的线性动力学

Tianle Wang, Jiayu Liu, Zhongyuan Wu, Shenghao Jin, Wei Chen, Hao Xu, Ning Miao

机构 * Department of Data Science, City University of Hong Kong(香港城市大学数据科学系) Hong Kong Institute of AI for Science, City University of Hong Kong(香港城市大学人工智能科学研究院) Li Auto Inc. Beihang University(北航大学)

专题命中 数学推理 :reasoning(abstract);分类 cs.CL、cs.LG

AI总结 本文研究了强化学习可验证奖励(RLVR)在大语言模型训练中的内部动态,发现RLVR在多种模型和训练配置下均进入线性区域,通过实验和理论分析证明这种线性特性源于训练信号的高方差和噪声,且具有预测性和实用性。

Comments Major revision: substantially reorganized the manuscript and added a theoretical explanation section. The replacement is intended for the same arXiv paper; the core topic and contribution remain the same

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.21468 2026-05-21 cs.LG cs.CL 62%

You Only Need Minimal RLVR Training: Extrapolating LLMs via Rank-1 Trajectories

你只需要最小的RLVR训练:通过秩-1轨迹来扩展LLMs

Zhepei Wei, Xinyu Zhu, Wei-Lin Chen, Chengsong Huang, Jiaxin Huang, Yu Meng

机构 * University of Virginia(弗吉尼亚大学) Washington University in St. Louis(华盛顿大学圣路易斯分校)

专题命中 数学推理 :reasoning(abstract);分类 cs.CL、cs.LG

AI总结 本文研究了通过秩-1轨迹扩展LLMs的方法,发现RLVR参数轨迹具有极低的秩和高度可预测性,并提出RELEX方法,通过简单的线性回归在无需训练模型的情况下实现高效的超量扩展。

Comments preprint. Code: https://github.com/weizhepei/RELEX

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.21467 2026-05-21 cs.LG cs.CL 62%

DelTA: Discriminative Token Credit Assignment for Reinforcement Learning from Verifiable Rewards

DelTA: 一种用于可验证奖励强化学习的判别性token信用分配

Kaiyi Zhang, Wei Wu, Yankai Lin

机构 * Gaoling School of Artificial Intelligence, Renmin University of China(中国人民大学人工智能学院 Gallagher 学院) Ant International(蚂蚁国际)

专题命中 数学推理 :reasoning(abstract);分类 cs.CL、cs.LG

AI总结 本文提出DelTA方法,通过估计token系数来增强特定侧的token梯度方向,从而改进可验证奖励强化学习中的token概率更新,提升了模型在数学基准测试中的性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.21266 2026-05-21 cs.LG cs.AI 62%

How Much Online RL is Enough? Informative Rollouts for Offline Preference Optimization in RLVR

在线强化学习需要多少?用于RLVR中离线偏好优化的信息性回放

Richa Verma, Balaraman Ravindran

机构 * TCS Research Department of CSE(TCS计算机科学系研究部) IIT Madras(印度理工学院马德拉斯分校) Department of Data Science & AI(数据科学与人工智能系) Wadhwani School of Data Science & AI(Wadhwani数据科学与人工智能学院)

专题命中 数学推理 :reasoning(abstract);分类 cs.AI、cs.LG

AI总结 本文提出G2D方法,通过短时GRPO预热、构建静态偏好数据集和离线DPO微调,以较低的计算成本实现优于GRPO的性能,强调偏好数据信息性而非数量的重要性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.20994 2026-05-21 cs.CL cs.AI 62%

Towards Context-Invariant Safety Alignment for Large Language Models

面向大语言模型的上下文不变安全对齐

Yixu Wang, Yang Yao, Xin Wang, Yifeng Gao, Yan Teng, Xingjun Ma, Yingchun Wang

机构 * Fudan University, Shanghai, China(复旦大学,上海,中国) Shanghai Artificial Intelligence Laboratory, Shanghai, China(上海人工智能实验室,上海,中国)

专题命中 数学推理 :reasoning(abstract);分类 cs.CL、cs.AI

AI总结 本文提出了一种上下文不变的安全对齐方法,通过引入锚点不变正则化(AIR)来提升模型在不同上下文中的鲁棒性,从而增强安全约束对对抗性框架的抵抗力。

Comments ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.20722 2026-05-21 cs.LG cs.AI 62%

AGPO: Adaptive Group Policy Optimization with Dual Statistical Feedback

AGPO: 基于双统计反馈的自适应群体策略优化

Miaobo Hu, Shuhao Hu, Bokun Wang, Ruohan Wang, Xin Wang, Xiaobo Guo, Daren Zha, Jun Xiao

机构 * Institute of Information Engineering, Chinese Academy of Sciences(中国科学院信息工程研究所) School of Cyber Security, University of Chinese Academy of Sciences(中国科学院大学网络安全学院) School of Artificial Intelligence, University of Chinese Academy of Sciences(中国科学院大学人工智能学院)

专题命中 数学推理 :reasoning(abstract);分类 cs.AI、cs.LG

AI总结 本文提出AGPO,一种无 critic 的 GRPO 改进方法,通过群体层面的统计信息控制更新幅度和探索。在九个英语和中文数学/STEM 基准上,Qwen2.5-14B 在相同生成 token 预算下优于 PPO/GRPO,达到 GSM8K 67.3% 和 MATH 40.5%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.18924 2026-05-20 cs.LG cs.AI 62%

Noise-corrected GRPO: From Noisy Rewards to Unbiased Gradients

噪声校正的GRPO:从噪声奖励到无偏梯度

Omar El Mansouri, Fathinah Asma Izzati, Mohamed El Amine Seddik, Salem Lahlou

机构 * Department of Machine Learning, Mohamed bin Zayed University of Artificial Intelligence, Abu Dhabi, UAE Technology Innovation Institute, Abu Dhabi, UAE Department of Robotics, Khalifa University, Abu Dhabi, UAE

专题命中 数学推理 :reasoning(abstract);分类 cs.AI、cs.LG

AI总结 本文提出了一种噪声鲁棒的GRPO框架,通过校正奖励中的噪声来获得无偏梯度估计,从而提升强化学习在噪声环境中的性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.19523 2026-05-20 cs.CL cs.AI cs.CV 62%

Investigating Cross-Modal Skill Injection: Scenarios, Methods, and Hyperparameters

探究跨模态技能注入:场景、方法与超参数

Zhiyu Xu, Lean Wang, Yuanxin Liu, Lei Li, Hao Zhou, Fandong Meng, Jie Zhou, Xu Sun

机构 * State Key Laboratory for Multimedia Information Processing, School of Computer Science, Peking University(多媒体信息处理国家重点实验室,计算机科学学院,北京大学) WeChat AI, Tencent Inc., China(腾讯公司,中国) The University of Hong Kong(香港大学)

专题命中 数学推理 :reasoning(abstract);分类 cs.CL、cs.AI

AI总结 本文研究了跨模态技能注入在不同场景下的表现,分析了其方法和超参数的影响,发现其在指令遵循和跨语言任务中表现良好,但在数学推理中存在困难,同时指出经典方法如TA和DARE在性能上优于其他融合方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.19425 2026-05-20 cs.LG cs.AI 62%

When to Stop Reusing: Dynamic Gradient Gating for Sample-Efficient RLVR

何时停止重用:动态梯度门控用于样本高效的RLVR

Yuchun Miao, Sen Zhang, Yuqi Zhang, Yaorui Shi, Qi Gu, Xunliang Cai, Lefei Zhang

机构 * National Engineering Research Center for Multimedia Software, School of Computer Science, Wuhan University(国家多媒体软件工程研究中心,武汉大学计算机学院) Meituan Longcat Team(美团Longcat团队) The University of Sydney(悉尼大学) University of Science and Technology of China(中国科学技术大学)

专题命中 数学推理 :reasoning(abstract);分类 cs.AI、cs.LG

AI总结 本文提出动态梯度门控(DGG)方法,通过实时监控lm_head梯度范数来检测并阻止有害的梯度传播,从而提高样本效率和训练速度。

Comments 23 pages, 10 figures

详情

展开后加载摘要…

URL PDF HTML 收藏