Experience Augmented Policy Optimization for LLM Reasoning
经验增强策略优化用于大语言模型推理
专题命中 数学推理 :reasoning(title,abstract);分类 cs.LG
AI总结 提出经验增强策略优化(EAPO),通过将先验RL优化策略作为动作级经验先验并在关键决策点选择性注入,配合自适应重要性采样,解决RLVR中采样成本高和经验利用不足问题,在多个基准上提升推理性能。
AI 大模型
大模型数学、逻辑、规划、多步推理和测试时计算能力。
经验增强策略优化用于大语言模型推理
专题命中 数学推理 :reasoning(title,abstract);分类 cs.LG
AI总结 提出经验增强策略优化(EAPO),通过将先验RL优化策略作为动作级经验先验并在关键决策点选择性注入,配合自适应重要性采样,解决RLVR中采样成本高和经验利用不足问题,在多个基准上提升推理性能。
揪出搭便车者:基于夏普利值的强化学习并行推理奖励归因
机构 * ShanghaiTech University(上海科技大学) ; City University of Hong Kong(香港城市大学) ; Peking University(北京大学) ; The Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳)) ; Zhejiang University(浙江大学)
专题命中 数学推理 :reasoning(title,abstract);分类 cs.AI
AI总结 研究大型语言模型多步推理中并行推理路径贡献难区分问题,提出基于夏普利值的强化学习框架并行夏普利值方法,通过量化边际贡献等实现按比例分配奖励,实验证明其优于基线且能改进多路径推理。
Comments 19 pages, 4 figures, 8 Tables
已知事实导致的推理错误:针对大语言模型的步骤级自一致性组相对策略优化
机构 * Zhejiang University(浙江大学)
专题命中 数学推理 :reasoning(title,abstract);分类 cs.CL
AI总结 针对大语言模型推理中因上下文干扰产生事实错误的问题,提出步骤级自一致性组相对策略优化(SSC - GRPO),通过计算自一致性分数分配步骤级奖励,在数学推理基准和幻觉排行榜上取得领先,为检测和减轻幻觉提供新视角。
用于小型语言模型算术微调的结构化合成推理数据
机构 * University of Galway(戈尔韦大学) ; School of Computer Science(计算机科学学院)
专题命中 数学推理 :reasoning(title,abstract);分类 cs.AI
AI总结 研究小型语言模型多步算术推理困难问题,通过生成结构化合成推理数据并结合LoRA在消费硬件上微调Qwen3模型,提高了模型在GSM8K等基准测试上的准确率和迁移效果,证明低成本合成数据设计可改善小型语言模型算术适应性。
用于混合表格和文本的金融推理的黄金引导式程序蒸馏
专题命中 数学推理 :reasoning(title,abstract);分类 cs.CL
AI总结 研究针对混合表格和文本数据的金融推理问题,基于程序蒸馏开发方法,利用黄金推导指导程序合成,经执行验证转移可靠数值推理,引入迭代恢复阶段,实验表明该框架能有效训练小模型进行可靠数值推理。
Comments 12 pages, 7 figures
MIRA-Math:最小信息请求与数学推理基准测试
机构 * Lebanese American University(黎巴嫩美国大学)
专题命中 数学推理 :reasoning(title,abstract);分类 cs.AI
AI总结 介绍MIRA-Math基准测试,用于解决特定数学问题,求解器需按预算请求缺失信息并整合到答案,包含多类实例,实验表明请求成功率和答案准确率可分离,还发布相关工具支持可重复评估。
为何纯推理不足:自然作为数学创新之源
机构 * IBM T. J. Watson Research Center(IBM T. J. 沃森研究中心)
专题命中 数学推理 :reasoning(title,abstract);分类 cs.AI
AI总结 研究认为人类数学推理受逻辑片段不可判定性和计算难题限制,依赖自然世界的模式匹配。通过追溯傅里叶变换等数学史及逻辑复杂性,表明物理启发的模式匹配是认知必要,为人工智能中语言模型规模大提供依据。
强化学习中的奖励粒度:比较用于小语言模型数学推理的过程奖励和结果奖励结构
机构 * New York University(纽约大学)
专题命中 数学推理 :reasoning(title,abstract);分类 cs.LG
AI总结 研究在小语言模型中通过强化学习提升数学推理能力,系统比较五种奖励条件,发现过程奖励能显著提高准确率和推理痕迹保真度,奖励粒度是重要设计决策。
Comments 8 pages, 4 figures
ISM:面向持续数学推理的自我改进策略记忆
专题命中 数学推理 :reasoning(title,abstract);分类 cs.LG
AI总结 提出智能模式记忆(ISM),一种自我演进的记忆增强系统,通过从成功和失败案例中学习并维护策略模式库,在不更新模型参数的情况下提升冻结LLM在持续学习中的数学推理能力。
Comments 3rd AI for Math Workshop at ICML 2026 Forty-Third International Conference on Machine Learning
GryphOne: 面向离线手写数学表达式识别中结构细化的符号感知掩码扩散
机构 * Preferred Networks, Inc.(Preferred Networks公司) ; Kyushu University(九州大学)
专题命中 数学推理 :reasoning(title,abstract);分类 cs.LG
AI总结 提出离散扩散框架GryphOne,将HMER重构为迭代符号细化而非序列生成,通过符号感知分词和随机掩码互学习提升鲁棒性,在MathWriting上达到5.51% CER和59.9% EM,超越所有重实现模型和商业系统。
Comments ECCV 2026
NeuReasoner: 理论驱动的推理激发边界映射
机构 * ETH Zürich(苏黎世联邦理工学院) ; Imperial College London(伦敦帝国理工学院) ; Technical University of Munich(慕尼黑技术大学)
专题命中 数学推理 :reasoning(title,abstract);分类 cs.LG
AI总结 提出理论驱动的NeuReasoner框架,通过神经透镜与认知透镜结合,在无需外部工具下激发大模型推理能力,在数学、编码及认知任务上匹配或超越后训练思维模式,并发现风险决策等边界。
HippoSpark: 一种用于LLM推理的按需经验系统
专题命中 数学推理 :reasoning(title,abstract);分类 cs.AI
AI总结 提出HippoSpark状态级经验系统,在推理过程中按需检索局部瓶颈的精确指导,在数学、科学和编程基准上优于标准提示和任务级经验基线。
多模态数学推理与多样化的解题视角
机构 * Tongji University(同济大学) ; National University of Singapore(新加坡国立大学) ; Institute of Data Science, National University of Singapore(新加坡国立大学数据科学研究所) ; Tencent(腾讯) ; Center for Future Media, University of Electronic Science and Technology of China(电子科技大学未来媒体中心)
专题命中 数学推理 :reasoning(title,abstract);分类 cs.CL
AI总结 本文提出MathV-DP数据集和Qwen-VL-DP模型,通过多样化解题视角提升多模态数学推理的准确性和生成多样性。
Comments 10 pages
谜语谜题:测试大型语言模型和人类的灵活推理
机构 * Department of Psychology, Princeton University(普林斯顿大学心理学系) ; Department of Computer Science, Princeton University(普林斯顿大学计算机科学系)
专题命中 数学推理 :reasoning(title,abstract);分类 cs.CL
AI总结 通过谜语谜题范式,发现LLM在真实谜语上准确率高(84.9%),但在谜语谜题上表现差(50.7%),而人类相反;错误分析表明LLM更倾向于过度使用创造性推理。
推理质量早期涌现:推理模型的数据策展
专题命中 数学推理 :reasoning(title,abstract);分类 cs.LG
AI总结 提出仅利用初始推理token即可识别多样且具挑战性的推理样本,通过扰动检查点评估前100个token的损失检测难题,并证明前1k token的损失模式可预测梯度相似性,在Qwen2.5-7B和Llama3.1-8B上验证,性能提升达1.7%,token效率提升91%。
Comments Accepted by ICML 2026 (Poster)
推理作为吸引子动力学:通过吉布斯加权能量最小化的潜在记忆检索
机构 * Independent Researcher(独立研究者)
专题命中 数学推理 :reasoning(title,abstract);分类 cs.LG
AI总结 提出将大语言模型视为高维稠密联想记忆,通过吉布斯加权能量最小化从潜在吸引子中检索正确推理链,在GSM8K上提升Phi-3.5性能5.38%。
Comments Accepted at ICLR Workshop 2026
ReM-MoA:推理记忆维持混合代理的扩展
机构 * University of Southern California(南加州大学) ; Iowa State University(爱荷华州立大学) ; Cisco AI Research(思科人工智能研究院)
专题命中 数学推理 :reasoning(title,abstract);分类 cs.AI
AI总结 提出ReM-MoA框架,通过排名推理记忆和策展多样化记忆路由机制,解决混合代理架构随深度增加性能退化问题,在多个推理基准上持续优于现有方法。
超越轨迹模仿:策略引导的策略优化用于大语言模型推理
机构 * School of Computer Science and Engineering, Sun Yat-sen University, China(中山大学计算机科学与工程学院) ; Meituan, Inc., China(美团) ; Shenzhen Loop Area Institute, China(深圳环区研究所) ; Meta AI, USA(Meta AI)
专题命中 数学推理 :reasoning(title,abstract);分类 cs.AI
AI总结 提出策略引导的策略优化(SGPO),通过可重用策略蒸馏替代实例级轨迹模仿,利用前向KL散度和自适应加权提升LLM推理泛化能力,在数学基准上平均提升2.2分。
RL提升LLM推理能力的关键更新因素是什么?
机构 * School of Computer Science and Engineering, Northeastern University(东北大学计算机科学与工程学院) ; Microsoft Research(微软研究院) ; Carnegie Mellon University(卡内基梅隆大学)
专题命中 数学推理 :reasoning(title,abstract);分类 cs.CL
AI总结 通过理论分析RLVR更新,发现离策略程度影响重要性采样比率分布和裁剪行为,提出自适应裁剪策略优化(ACPO),在多种推理基准上优于DAPO和CISPO。
先看后思:解耦感知与推理以实现抗捷径的多模态在策略自蒸馏
机构 * State Key Laboratory of Robotics and Intelligent Systems, Shenyang Institute of Automation, Chinese Academy of Sciences(机器人与智能系统国家重点实验室,沈阳自动化研究所,中国科学院) ; University of Chinese Academy of Sciences(中国科学院大学)
专题命中 数学推理 :reasoning(title,abstract);分类 cs.LG
AI总结 提出ViGOS框架,通过解耦感知和推理,在MLLM后训练中避免文本捷径,提升图像依赖行为。
Comments 29 pages, 5 figures, 8 tables; Project page: https://oedosoldier.github.io/ViGOS/
超越熵:从令牌级分布偏差中学习以增强LLM推理
机构 * The Hong Kong University of Science and Technology(香港科技大学) ; Sichuan University(四川大学) ; The Hong Kong Polytechnic University(香港理工大学)
专题命中 数学推理 :reasoning(title,abstract);分类 cs.AI
AI总结 针对RLVR中令牌更新导致的熵塌陷或爆炸问题,提出ICT框架,利用JS散度识别关键令牌,通过选择性更新平衡策略集中度,提升推理性能。
质量-效用悖论:为什么高奖励数据会损害小模型的数学推理
机构 * University of Science and Technology of China(中国科学技术大学)
专题命中 数学推理 :reasoning(title,abstract);分类 cs.AI
AI总结 发现数学推理蒸馏中的质量-效用悖论:Oracle精炼的高奖励数据因分布漂移增加适应成本,反而不如SLM自生成数据;提出风格对齐精炼方法恢复效用。
Comments Accepted at ICML 2026
自适应核截断用于长形式推理
机构 * University of California, Berkeley(加州大学伯克利分校)
专题命中 数学推理 :reasoning(title,abstract);分类 cs.LG
AI总结 提出自适应核截断采样(ANTS),通过熵条件控制器动态调整截断宽度,在长文本生成中提升推理性能,在33B参数稀疏MoE模型上平均提升1.9-5.2分。
当上下文分片到达时的多轮推理:可扩展的分片与记忆增强强化学习
机构 * The University of Melbourne(墨尔本大学) ; Google Research Australia(谷歌澳大利亚研究院)
专题命中 数学推理 :reasoning(title,abstract);分类 cs.CL
AI总结 针对多轮对话中信息碎片化导致LLM准确率下降65%的问题,提出通过训练模型维护紧凑滚动记忆而非增长历史来缓解,并引入低成本分片流水线将单轮QA转换为多轮碎片化情节,训练的记忆增强策略显著提升多轮准确率并零样本泛化到更难任务。
ARMOR-MAD:大语言模型推理中异构多智能体辩论的自适应路由
机构 * School of Cyber Science and Technology, University of Science and Technology of China(中国科学技术大学网络空间安全学院) ; School of Artificial Intelligence, Shenzhen Technology University(深圳技术大学人工智能学院)
专题命中 数学推理 :reasoning(title,abstract);分类 cs.AI
AI总结 提出ARMOR-MAD框架,通过辩论前协议路由、早期一致停止评估和语义异常检测,自适应控制异构多智能体辩论,提升推理准确性和效率。
面向协作问题求解与AI推理数据集生成的数学论坛平台
机构 * Independent Researchers, San Francisco, CA, USA(独立研究者,美国加利福尼亚州旧金山)
专题命中 数学推理 :reasoning(title,abstract);分类 cs.AI
AI总结 提出一个集成图像到LaTeX转换管线的论坛系统,消除数学内容分享的摩擦,支持桌面和移动端,并生成社区验证的数学问题数据集以训练AI推理。
Comments 11 pages, 3 figures
推理还是记忆?LLM强化学习中的方向感知多样性探索
机构 * University of Georgia(佐治亚大学) ; Tencent AI Lab(腾讯AI实验室) ; The Education University of Hong Kong(香港教育大学) ; The Hong Kong Polytechnic University(香港理工大学)
专题命中 数学推理 :reasoning(title,abstract);分类 cs.AI
AI总结 提出DiRL框架,通过方向感知奖励区分推理与记忆驱动的探索,在GRPO中集成方向加权梯度特征,显著提升数学与通用推理性能。
Comments 12 pages, 6 figures
多样思维图式激发大型语言模型更优推理
机构 * School of Computer Science and Technology, Beijing Institute of Technology(北京理工大学计算机科学与技术学院)
专题命中 数学推理 :reasoning(title,abstract);分类 cs.AI
AI总结 提出多样图式策略优化(DiScO),通过增强推理步骤转换和答案候选的多样性,提升大型语言模型在数学推理任务中的表现和错误恢复能力。
PAEC:面向RLVR中LLM推理的位置感知熵校准
机构 * Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所) ; School of Artificial Intelligence, University of Chinese Academy of Sciences(中国科学院大学人工智能学院) ; School of Artificial Intelligence, Beijing University of Posts and Telecommunications(北京邮电大学人工智能学院) ; Institute of Computing Technology, Chinese Academy of Sciences(中国科学院计算技术研究所) ; School of Computer Science and Technology, University of Chinese Academy of Sciences(中国科学院大学计算机科学与技术学院)
专题命中 数学推理 :reasoning(title,abstract);分类 cs.AI
AI总结 提出位置感知熵校准(PAEC),通过局部top-p熵和top-2候选竞争构建软掩码,并施加基于锚点的下界惩罚,防止决策相关位置熵崩溃,提升数学推理性能。
Comments 22 pages, 7 figures
CLPO:课程学习与策略优化相结合用于大语言模型推理
机构 * Peking University(北京大学) ; Qwen Applications Business Group, Alibaba Group(通义实验室,阿里巴巴集团) ; Xiamen University(厦门大学)
专题命中 数学推理 :reasoning(title,abstract);分类 cs.AI
AI总结 提出CLPO框架,通过在线策略准确率动态调整问题难度,使课程与策略共同进化,在数学和通用推理基准上显著优于GRPO和DAPO。