Beyond the Mean: Multi-Moment Policy Optimization for LLM Reasoning
超越均值:面向大语言模型推理的多时刻策略优化
专题命中 数学推理 :reasoning(title,abstract);分类 cs.AI
AI总结 本文针对大语言模型推理提出多时刻策略优化(MMPO)框架,联合最小化失败概率分布的多个矩,在五个数学推理基准上优于基线方法,为策略优化目标设计提供新视角。
AI 大模型
大模型数学、逻辑、规划、多步推理和测试时计算能力。
超越均值:面向大语言模型推理的多时刻策略优化
专题命中 数学推理 :reasoning(title,abstract);分类 cs.AI
AI总结 本文针对大语言模型推理提出多时刻策略优化(MMPO)框架,联合最小化失败概率分布的多个矩,在五个数学推理基准上优于基线方法,为策略优化目标设计提供新视角。
HPFA:基于超图的大语言模型推理配对失败归因
专题命中 数学推理 :reasoning(title,abstract);分类 cs.AI
AI总结 本研究针对LLM推理的失败归因缺陷,提出HPFA框架,通过超图配对分析高效定位根本原因,提升归因准确率与效率,训练的归因器可改善推理性能。
准确率等同于证据吗?KV缓存压缩下的推理忠实性
机构 * University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校)
专题命中 数学推理 :reasoning(title,abstract);分类 cs.CL
AI总结 该研究针对大型推理模型,发现KV缓存压缩中存在答案-证据差距,即令牌驱逐类方法可保留高准确率却大幅降低推理忠实性,而量化方法受影响更小,表明失效源于推理轨迹部分丢失。
Comments https://github.com/famous-blue-raincoat/Safe_KV_Compress
潜思维信用:面向潜推理的多答案信用分配
专题命中 数学推理 :reasoning(title,abstract);分类 cs.AI
AI总结 该研究针对潜推理的信用分配难题,提出LTC分层框架,结合多答案估计与GRPO在线策略训练,在数学推理等任务上取得最优平均准确率,可降低奖励估计误差并缓解思维级信用问题。
逃离置信陷阱:扩散大语言模型数学推理的进化解码
机构 * Australian National University(澳大利亚国立大学) ; Nanyang Technological University(南洋理工大学) ; National University of Singapore(新加坡国立大学) ; Amazon(亚马逊) ; University of Technology Sydney(悉尼科技大学)
专题命中 数学推理 :reasoning(title,abstract);分类 cs.AI
AI总结 针对扩散大语言模型数学推理的置信陷阱,提出无训练的进化解码框架,通过逐步选择与分块变异提升LLaDA 2.0的数学推理可靠性。
CORE:通过交叉教学实现协同推理
机构 * Mohamed bin Zayed University of Artificial Intelligence (MBZUAI)(穆罕默德·本·扎耶德人工智能大学)
专题命中 数学推理 :reasoning(title,abstract);分类 cs.AI
AI总结 CORE通过交叉教学实现协同推理,利用模型互补性提升推理性能,无需扩大模型规模。
AMTFV:面向LLM自校正的智能体数学工具流验证
专题命中 数学推理 :self-correction(title);reasoning(abstract);分类 cs.AI
AI总结 本研究针对LLM数学答案验证难题,提出AMTFV方法,通过MTF接口解耦验证建模与执行,在5个数学推理数据集上较基线提升最高8.3个百分点,验证复杂度越高增益越显著。
Comments 19 pages, 9 figures
Lightning OPD 2.0:缓解大型推理模型跨教师在线策略蒸馏中的风格偏差
机构 * NVIDIA(英伟达)
专题命中 数学推理 :reasoning(title,abstract);分类 cs.CL
AI总结 Lightning OPD 2.0通过交叉拟合风格残差化缓解大型推理模型跨教师在线策略蒸馏的风格偏差,在数学推理与代码生成基准中优于原方法,实现了跨教师设置下的性能提升。
技能使用还是技能表演?评估技能增强型语言智能体中的推理后台
专题命中 数学推理 :reasoning(title,abstract);分类 cs.AI
AI总结 本研究针对技能增强型语言智能体,提出BACKTRACE评估框架及BACKROOMBench测试平台,发现其存在推理后台现象,即技能使用声明与实际决策影响存在系统性差距,需通过干预进行审计。
Comments 21 pages
DenoiseRL:引导推理模型从噪声前缀中恢复
机构 * Fudan University(复旦大学) ; Shanghai Innovation Institute(上海创新研究院)
专题命中 数学推理 :reasoning(title,abstract);分类 cs.AI
AI总结 提出DenoiseRL框架,通过强化学习从弱模型的错误推理中学习,无需外部监督或强教师模型,提升推理性能和训练效率。
Comments 17 pages, 5 figures
数学问题解决中大型语言模型在可执行推理约束下的表示鲁棒性
专题命中 数学推理 :reasoning(title,abstract);分类 cs.AI
AI总结 研究大型语言模型在数学问题解决中表示鲁棒性,通过改变问题表面表示评估五个模型,发现其对表示敏感,代码增强未统一提升鲁棒性,揭示了正确性等方面新权衡,强调表示应作为接口设计变量。
Comments presented at the 28th International Conference on Human-Computer Interaction (2026), Montreal, Canada
EvoThink:通过自剪枝和顿悟时刻偏好优化在大型推理模型中进化思维
机构 * Southeast University(东南大学) ; Noah’s Ark Lab(诺亚方舟实验室)
专题命中 数学推理 :reasoning(title,abstract);分类 cs.AI
AI总结 研究针对大型推理模型过度思考问题,提出EvoThink框架,含自剪枝训练和顿悟时刻偏好优化两个关键组件,能减少冗余验证、探索新推理路径,经评估可提高推理效率与能力。
Comments 9 pages, 7 figures, accepted by IJCAI 2026
经验增强策略优化用于大语言模型推理
专题命中 数学推理 :reasoning(title,abstract);分类 cs.LG
AI总结 提出经验增强策略优化(EAPO),通过将先验RL优化策略作为动作级经验先验并在关键决策点选择性注入,配合自适应重要性采样,解决RLVR中采样成本高和经验利用不足问题,在多个基准上提升推理性能。
揪出搭便车者:基于夏普利值的强化学习并行推理奖励归因
机构 * ShanghaiTech University(上海科技大学) ; City University of Hong Kong(香港城市大学) ; Peking University(北京大学) ; The Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳)) ; Zhejiang University(浙江大学)
专题命中 数学推理 :reasoning(title,abstract);分类 cs.AI
AI总结 研究大型语言模型多步推理中并行推理路径贡献难区分问题,提出基于夏普利值的强化学习框架并行夏普利值方法,通过量化边际贡献等实现按比例分配奖励,实验证明其优于基线且能改进多路径推理。
Comments 19 pages, 4 figures, 8 Tables
已知事实导致的推理错误:针对大语言模型的步骤级自一致性组相对策略优化
机构 * Zhejiang University(浙江大学)
专题命中 数学推理 :reasoning(title,abstract);分类 cs.CL
AI总结 针对大语言模型推理中因上下文干扰产生事实错误的问题,提出步骤级自一致性组相对策略优化(SSC - GRPO),通过计算自一致性分数分配步骤级奖励,在数学推理基准和幻觉排行榜上取得领先,为检测和减轻幻觉提供新视角。
用于小型语言模型算术微调的结构化合成推理数据
机构 * University of Galway(戈尔韦大学) ; School of Computer Science(计算机科学学院)
专题命中 数学推理 :reasoning(title,abstract);分类 cs.AI
AI总结 研究小型语言模型多步算术推理困难问题,通过生成结构化合成推理数据并结合LoRA在消费硬件上微调Qwen3模型,提高了模型在GSM8K等基准测试上的准确率和迁移效果,证明低成本合成数据设计可改善小型语言模型算术适应性。
用于混合表格和文本的金融推理的黄金引导式程序蒸馏
专题命中 数学推理 :reasoning(title,abstract);分类 cs.CL
AI总结 研究针对混合表格和文本数据的金融推理问题,基于程序蒸馏开发方法,利用黄金推导指导程序合成,经执行验证转移可靠数值推理,引入迭代恢复阶段,实验表明该框架能有效训练小模型进行可靠数值推理。
Comments 12 pages, 7 figures
MIRA-Math:最小信息请求与数学推理基准测试
机构 * Lebanese American University(黎巴嫩美国大学)
专题命中 数学推理 :reasoning(title,abstract);分类 cs.AI
AI总结 介绍MIRA-Math基准测试,用于解决特定数学问题,求解器需按预算请求缺失信息并整合到答案,包含多类实例,实验表明请求成功率和答案准确率可分离,还发布相关工具支持可重复评估。
为何纯推理不足:自然作为数学创新之源
机构 * IBM T. J. Watson Research Center(IBM T. J. 沃森研究中心)
专题命中 数学推理 :reasoning(title,abstract);分类 cs.AI
AI总结 研究认为人类数学推理受逻辑片段不可判定性和计算难题限制,依赖自然世界的模式匹配。通过追溯傅里叶变换等数学史及逻辑复杂性,表明物理启发的模式匹配是认知必要,为人工智能中语言模型规模大提供依据。
强化学习中的奖励粒度:比较用于小语言模型数学推理的过程奖励和结果奖励结构
机构 * New York University(纽约大学)
专题命中 数学推理 :reasoning(title,abstract);分类 cs.LG
AI总结 研究在小语言模型中通过强化学习提升数学推理能力,系统比较五种奖励条件,发现过程奖励能显著提高准确率和推理痕迹保真度,奖励粒度是重要设计决策。
Comments 8 pages, 4 figures
ISM:面向持续数学推理的自我改进策略记忆
专题命中 数学推理 :reasoning(title,abstract);分类 cs.LG
AI总结 提出智能模式记忆(ISM),一种自我演进的记忆增强系统,通过从成功和失败案例中学习并维护策略模式库,在不更新模型参数的情况下提升冻结LLM在持续学习中的数学推理能力。
Comments 3rd AI for Math Workshop at ICML 2026 Forty-Third International Conference on Machine Learning
GryphOne: 面向离线手写数学表达式识别中结构细化的符号感知掩码扩散
机构 * Preferred Networks, Inc.(Preferred Networks公司) ; Kyushu University(九州大学)
专题命中 数学推理 :reasoning(title,abstract);分类 cs.LG
AI总结 提出离散扩散框架GryphOne,将HMER重构为迭代符号细化而非序列生成,通过符号感知分词和随机掩码互学习提升鲁棒性,在MathWriting上达到5.51% CER和59.9% EM,超越所有重实现模型和商业系统。
Comments ECCV 2026
NeuReasoner: 理论驱动的推理激发边界映射
机构 * ETH Zürich(苏黎世联邦理工学院) ; Imperial College London(伦敦帝国理工学院) ; Technical University of Munich(慕尼黑技术大学)
专题命中 数学推理 :reasoning(title,abstract);分类 cs.LG
AI总结 提出理论驱动的NeuReasoner框架,通过神经透镜与认知透镜结合,在无需外部工具下激发大模型推理能力,在数学、编码及认知任务上匹配或超越后训练思维模式,并发现风险决策等边界。
HippoSpark: 一种用于LLM推理的按需经验系统
专题命中 数学推理 :reasoning(title,abstract);分类 cs.AI
AI总结 提出HippoSpark状态级经验系统,在推理过程中按需检索局部瓶颈的精确指导,在数学、科学和编程基准上优于标准提示和任务级经验基线。
多模态数学推理与多样化的解题视角
机构 * Tongji University(同济大学) ; National University of Singapore(新加坡国立大学) ; Institute of Data Science, National University of Singapore(新加坡国立大学数据科学研究所) ; Tencent(腾讯) ; Center for Future Media, University of Electronic Science and Technology of China(电子科技大学未来媒体中心)
专题命中 数学推理 :reasoning(title,abstract);分类 cs.CL
AI总结 本文提出MathV-DP数据集和Qwen-VL-DP模型,通过多样化解题视角提升多模态数学推理的准确性和生成多样性。
Comments 10 pages
谜语谜题:测试大型语言模型和人类的灵活推理
机构 * Department of Psychology, Princeton University(普林斯顿大学心理学系) ; Department of Computer Science, Princeton University(普林斯顿大学计算机科学系)
专题命中 数学推理 :reasoning(title,abstract);分类 cs.CL
AI总结 通过谜语谜题范式,发现LLM在真实谜语上准确率高(84.9%),但在谜语谜题上表现差(50.7%),而人类相反;错误分析表明LLM更倾向于过度使用创造性推理。
推理质量早期涌现:推理模型的数据策展
专题命中 数学推理 :reasoning(title,abstract);分类 cs.LG
AI总结 提出仅利用初始推理token即可识别多样且具挑战性的推理样本,通过扰动检查点评估前100个token的损失检测难题,并证明前1k token的损失模式可预测梯度相似性,在Qwen2.5-7B和Llama3.1-8B上验证,性能提升达1.7%,token效率提升91%。
Comments Accepted by ICML 2026 (Poster)
推理作为吸引子动力学:通过吉布斯加权能量最小化的潜在记忆检索
机构 * Independent Researcher(独立研究者)
专题命中 数学推理 :reasoning(title,abstract);分类 cs.LG
AI总结 提出将大语言模型视为高维稠密联想记忆,通过吉布斯加权能量最小化从潜在吸引子中检索正确推理链,在GSM8K上提升Phi-3.5性能5.38%。
Comments Accepted at ICLR Workshop 2026
ReM-MoA:推理记忆维持混合代理的扩展
机构 * University of Southern California(南加州大学) ; Iowa State University(爱荷华州立大学) ; Cisco AI Research(思科人工智能研究院)
专题命中 数学推理 :reasoning(title,abstract);分类 cs.AI
AI总结 提出ReM-MoA框架,通过排名推理记忆和策展多样化记忆路由机制,解决混合代理架构随深度增加性能退化问题,在多个推理基准上持续优于现有方法。
超越轨迹模仿:策略引导的策略优化用于大语言模型推理
机构 * School of Computer Science and Engineering, Sun Yat-sen University, China(中山大学计算机科学与工程学院) ; Meituan, Inc., China(美团) ; Shenzhen Loop Area Institute, China(深圳环区研究所) ; Meta AI, USA(Meta AI)
专题命中 数学推理 :reasoning(title,abstract);分类 cs.AI
AI总结 提出策略引导的策略优化(SGPO),通过可重用策略蒸馏替代实例级轨迹模仿,利用前向KL散度和自适应加权提升LLM推理泛化能力,在数学基准上平均提升2.2分。