V-STaR: Training Verifiers for Self-Taught Reasoners
专题命中 数学推理 :reasoning(abstract);math reasoning(abstract);verifier(abstract);分类 cs.CL、cs.AI、cs.LG
AI 大模型
大模型数学、逻辑、规划、多步推理和测试时计算能力。
专题命中 数学推理 :reasoning(abstract);math reasoning(abstract);verifier(abstract);分类 cs.CL、cs.AI、cs.LG
DirEAG:用于校准数学推理中口头表述置信度的Dirichlet证据聚合方法
专题命中 数学推理 :reasoning(title,abstract);分类 cs.AI
AI总结 针对大语言模型数学推理中口头表述置信度难以校准的问题,提出DirEAG方法,将置信度观测值转换为校准软证据,在多个数据集和模型上验证其校准效果优于现有方法。
Comments 16 pages, 3 figures. Code is available at this https URL (https://github.com/horacehsugithub/DirEAG). Accepted by PRICAI 2026
超越黄金标准:用于形式化数学推理的LLM评判者的认知集成
专题命中 数学推理 :reasoning(title,abstract);分类 cs.CL
AI总结 本研究提出基于LLM评判者的认知与形式化基础集成(EFG),用于系统自动评估形式化数学推理中的语句自动形式化任务,实验证实其比粗粒度模型更具适用性。
为离线强化学习未来政策近似改进数学推理
机构 * Graduate School of Data Science, Seoul National University(首尔大学数据科学研究生院)
专题命中 数学推理 :reasoning(title,abstract);分类 cs.CL
AI总结 本文提出未来政策近似方法,通过估计未来策略来优化离线强化学习中的梯度更新,提升长周期推理任务的稳定性与准确性。
Comments 12 pages
询问、条件化或弃权:针对缺失前提推理的强化学习
机构 * Ant International(蚂蚁国际) ; Zhejiang University(浙江大学) ; Dingtalk, Alibaba Group(阿里巴巴集团钉钉) ; Ant Group(蚂蚁集团)
专题命中 数学推理 :reasoning(title,abstract);分类 cs.CL
AI总结 本研究提出ACA-RL框架,结合MPB基准,训练模型应对缺失前提的推理任务,可询问、条件化或弃权,提升欠定问题处理能力。
测量位置混淆优化下的奖励黑客行为与推理-答案解耦
机构 * University of Massachusetts Amherst(马萨诸塞大学阿默斯特分校)
专题命中 数学推理 :reasoning(title,abstract);分类 cs.AI
AI总结 该研究针对位置混淆优化下的奖励黑客与推理-答案解耦问题,通过GRPO训练语言模型,发现模型会学习答案位置捷径,推理与答案解耦,且该捷径可跨域迁移,解耦率等指标可区分能力损失与捷径。
Comments Accepted at the AI Measurement Science Workshop, COLM 2026
思维简写:通过熵引导的超令牌压缩LLM推理
机构 * Writer, Inc.(Writer公司)
专题命中 数学推理 :reasoning(title,abstract);分类 cs.CL
AI总结 本文提出通过熵引导的超令牌压缩技术,减少LLM推理过程中的计算开销,同时保留推理结构信息,提升可解释性和效率。
Comments Accepted to COLM 2026. Code available at https://github.com/Writer/shorthand-for-thought
用于主观任务的大语言模型推理:失败模式、缓解措施与动态推理路由
机构 * Duke University(杜克大学) ; Netflix(网飞公司)
专题命中 数学推理 :reasoning(title,abstract);分类 cs.AI
AI总结 该研究针对主观任务中LLM推理的失败模式,提出带条件长度惩罚的后训练算法缓解推理崩溃,还发现推理风格不匹配是主观验证误差主因,给出算法补丁与架构蓝图。
Comments 20th ACM Conference on Recommender Systems (RecSys 2026)
从链到DAG:探测语言模型推理中的图结构
机构 * Columbia University(哥伦比亚大学)
专题命中 数学推理 :reasoning(title,abstract);分类 cs.CL
AI总结 研究探讨语言模型内部推理是否以有向无环图形式存在,通过设计探针验证DAG结构在各层的出现,并发现中间层具有最强的结构恢复能力。
合作推理的火花:LLMs作为战略汉诺塔代理
专题命中 数学推理 :reasoning(title,abstract);分类 cs.CL
AI总结 本文研究了在不完全信息下多智能体系统的合作推理挑战,通过汉诺塔游戏评估不同LLM模型在策略沟通和状态跟踪中的表现,展示了模型在协作游戏中的改进效果。
通过翻译-推理联合训练实现自我改进的多语言长推理
机构 * National Key Laboratory for Novel Software Technology, Nanjing University(新型软件技术国家重点实验室,南京大学) ; University of Tübingen(图宾根大学) ; China Mobile Communications Company Limited Research Institute(中国移动通信集团有限公司研究院)
专题命中 数学推理 :reasoning(title,abstract);分类 cs.CL
AI总结 TRIT通过整合翻译训练提升多语言长推理能力,在MMATH上超越基线7个百分点,提升答案正确性和语言一致性。
Comments 16 pages, 11 figures
重新思考MDLM的推理:早期退出、事后推理及其他
机构 * Columbia University(哥伦比亚大学) ; Department of Computer Science, New York University(纽约大学计算机科学系) ; Microsoft Research(微软研究院) ; Center for Data Science, New York University(纽约大学数据科学中心)
专题命中 数学推理 :reasoning(title,abstract);分类 cs.LG
AI总结 本文提出“推理即填充”技术,基于掩码扩散语言模型(MDLMs)实现早期退出、事后推理等能力,在GSM8k数据集上微调LLaDA-8B-Base提升准确率14.9%,证明MDLM训练目标对推理有显著优势。
Comments COLM 2026 Camera Ready
DASH:用于推理模型在线自蒸馏的 divergence-adaptive 监督视界
专题命中 数学推理 :reasoning(title,abstract);分类 cs.AI
AI总结 针对标准在线自蒸馏(OPSD)未充分利用 rollout 时间结构的局限,提出 DASH 方法,通过自适应传播门调整 token 级监督权重,在三类数学推理基准、三种模型规模上均优于 vanilla OPSD,且无需额外前向传播。
Comments 17 pages, 4 figures, 9 tables. Code at https://github.com/DBtxy/DASH-OPSD
通过渐进压缩实现口语语言模型的高效模态链推理
机构 * Shanghai Jiao Tong University(上海交通大学) ; Shanghai Innovation Institute(上海创新研究院) ; Token Foundry, Alibaba Group(阿里巴巴集团淘系技术)
专题命中 数学推理 :reasoning(title,abstract);分类 cs.CL
AI总结 针对口语语言模型推理能力落后问题,提出高效模态链推理(ECoM推理),通过压缩文本组件提高推理准确性,并用渐进压缩策略训练,实验显示其在口语数学问答基准测试中,增强推理且保持效率,准确率提升显著。
推理链长度如何影响LLM对答案事实性的判断
机构 * State Key Laboratory of AI Safety(人工智能安全国家重点实验室) ; Institute of Computing Technology, Chinese Academy of Sciences(中国科学院计算技术研究所) ; University of Chinese Academy of Sciences(中国科学院大学) ; Beijing University of Post and Telecommunications(北京邮电大学)
专题命中 数学推理 :reasoning(title,abstract);分类 cs.CL
AI总结 研究探讨了推理链对LLM判断答案事实性的影响,发现弱判官易受推理存在影响,而强判官部分利用推理作为证据,但仍易被高质量推理链误导。
Comments ACL2026 Main
RP-OPSD:基于推理枢轴引导的多语言推理迁移在线策略自蒸馏
机构 * Nanjing University(南京大学)
专题命中 数学推理 :reasoning(title,abstract);分类 cs.CL
AI总结 该研究针对多语言推理迁移中现有在线策略自蒸馏未优先考虑关键推理信号的问题,提出 RP-OPSD 方法,利用教师视图分布偏移引导特权蒸馏,在 17 种语言的数学推理基准上优于基线,提升了多语言推理能力。
Comments 16 pages. Under review
Hyper-ES:通过下降方向合并实现LLM推理的有效进化策略
机构 * Southern University of Science and Technology(南方科技大学) ; National University of Singapore(新加坡国立大学) ; Nanjing University(南京大学)
专题命中 数学推理 :reasoning(title,abstract);分类 cs.AI
AI总结 本文提出Hyper-ES框架,通过梯度微调获取下降方向张成子空间,再用CMA-ES优化DARE-TIES合并系数,在数学推理任务上性能优于GRPO-LoRA,梯度更新量减少10%。
Comments 19 pages, 4 figures, 14 tables. Code: https://github.com/kuangrepi/Hyper-ES
v1: 为多模态 grounded 推理学习指向视觉标记
机构 * Yonsei University(延世大学) ; Seoul National University(首尔国立大学)
专题命中 数学推理 :reasoning(title,abstract);分类 cs.CL
AI总结 v1通过点对复制机制实现轻量级的主动视觉引用,提升多模态推理中视觉证据与推理空间的对齐性,优于现有基线模型。
Journal ref COLM 2026
超越均值:面向大语言模型推理的多时刻策略优化
专题命中 数学推理 :reasoning(title,abstract);分类 cs.AI
AI总结 本文针对大语言模型推理提出多时刻策略优化(MMPO)框架,联合最小化失败概率分布的多个矩,在五个数学推理基准上优于基线方法,为策略优化目标设计提供新视角。
HPFA:基于超图的大语言模型推理配对失败归因
专题命中 数学推理 :reasoning(title,abstract);分类 cs.AI
AI总结 本研究针对LLM推理的失败归因缺陷,提出HPFA框架,通过超图配对分析高效定位根本原因,提升归因准确率与效率,训练的归因器可改善推理性能。
准确率等同于证据吗?KV缓存压缩下的推理忠实性
机构 * University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校)
专题命中 数学推理 :reasoning(title,abstract);分类 cs.CL
AI总结 该研究针对大型推理模型,发现KV缓存压缩中存在答案-证据差距,即令牌驱逐类方法可保留高准确率却大幅降低推理忠实性,而量化方法受影响更小,表明失效源于推理轨迹部分丢失。
Comments https://github.com/famous-blue-raincoat/Safe_KV_Compress
潜思维信用:面向潜推理的多答案信用分配
专题命中 数学推理 :reasoning(title,abstract);分类 cs.AI
AI总结 该研究针对潜推理的信用分配难题,提出LTC分层框架,结合多答案估计与GRPO在线策略训练,在数学推理等任务上取得最优平均准确率,可降低奖励估计误差并缓解思维级信用问题。
逃离置信陷阱:扩散大语言模型数学推理的进化解码
机构 * Australian National University(澳大利亚国立大学) ; Nanyang Technological University(南洋理工大学) ; National University of Singapore(新加坡国立大学) ; Amazon(亚马逊) ; University of Technology Sydney(悉尼科技大学)
专题命中 数学推理 :reasoning(title,abstract);分类 cs.AI
AI总结 针对扩散大语言模型数学推理的置信陷阱,提出无训练的进化解码框架,通过逐步选择与分块变异提升LLaDA 2.0的数学推理可靠性。
CORE:通过交叉教学实现协同推理
机构 * Mohamed bin Zayed University of Artificial Intelligence (MBZUAI)(穆罕默德·本·扎耶德人工智能大学)
专题命中 数学推理 :reasoning(title,abstract);分类 cs.AI
AI总结 CORE通过交叉教学实现协同推理,利用模型互补性提升推理性能,无需扩大模型规模。
AMTFV:面向LLM自校正的智能体数学工具流验证
专题命中 数学推理 :self-correction(title);reasoning(abstract);分类 cs.AI
AI总结 本研究针对LLM数学答案验证难题,提出AMTFV方法,通过MTF接口解耦验证建模与执行,在5个数学推理数据集上较基线提升最高8.3个百分点,验证复杂度越高增益越显著。
Comments 19 pages, 9 figures
Lightning OPD 2.0:缓解大型推理模型跨教师在线策略蒸馏中的风格偏差
机构 * NVIDIA(英伟达)
专题命中 数学推理 :reasoning(title,abstract);分类 cs.CL
AI总结 Lightning OPD 2.0通过交叉拟合风格残差化缓解大型推理模型跨教师在线策略蒸馏的风格偏差,在数学推理与代码生成基准中优于原方法,实现了跨教师设置下的性能提升。
技能使用还是技能表演?评估技能增强型语言智能体中的推理后台
专题命中 数学推理 :reasoning(title,abstract);分类 cs.AI
AI总结 本研究针对技能增强型语言智能体,提出BACKTRACE评估框架及BACKROOMBench测试平台,发现其存在推理后台现象,即技能使用声明与实际决策影响存在系统性差距,需通过干预进行审计。
Comments 21 pages
DenoiseRL:引导推理模型从噪声前缀中恢复
机构 * Fudan University(复旦大学) ; Shanghai Innovation Institute(上海创新研究院)
专题命中 数学推理 :reasoning(title,abstract);分类 cs.AI
AI总结 提出DenoiseRL框架,通过强化学习从弱模型的错误推理中学习,无需外部监督或强教师模型,提升推理性能和训练效率。
Comments 17 pages, 5 figures
数学问题解决中大型语言模型在可执行推理约束下的表示鲁棒性
专题命中 数学推理 :reasoning(title,abstract);分类 cs.AI
AI总结 研究大型语言模型在数学问题解决中表示鲁棒性,通过改变问题表面表示评估五个模型,发现其对表示敏感,代码增强未统一提升鲁棒性,揭示了正确性等方面新权衡,强调表示应作为接口设计变量。
Comments presented at the 28th International Conference on Human-Computer Interaction (2026), Montreal, Canada
EvoThink:通过自剪枝和顿悟时刻偏好优化在大型推理模型中进化思维
机构 * Southeast University(东南大学) ; Noah’s Ark Lab(诺亚方舟实验室)
专题命中 数学推理 :reasoning(title,abstract);分类 cs.AI
AI总结 研究针对大型推理模型过度思考问题,提出EvoThink框架,含自剪枝训练和顿悟时刻偏好优化两个关键组件,能减少冗余验证、探索新推理路径,经评估可提高推理效率与能力。
Comments 9 pages, 7 figures, accepted by IJCAI 2026