iGRPO: Self-Feedback-Driven LLM Reasoning
iGRPO:基于自我反馈的LLM推理
机构 * NVIDIA(英伟达)
专题命中 数学推理 :reasoning(title,abstract);分类 cs.AI
AI总结 iGRPO通过动态自我条件和两阶段优化,提升LLM在数学推理任务中的表现,实现更准确和一致的解决方案。
Comments Tech report
AI 大模型
大模型数学、逻辑、规划、多步推理和测试时计算能力。
iGRPO:基于自我反馈的LLM推理
机构 * NVIDIA(英伟达)
专题命中 数学推理 :reasoning(title,abstract);分类 cs.AI
AI总结 iGRPO通过动态自我条件和两阶段优化,提升LLM在数学推理任务中的表现,实现更准确和一致的解决方案。
Comments Tech report
DyTopo:通过语义匹配实现多智能体推理的动态拓扑路由
机构 * Peking University, Beijing, China(北京大学) ; Georgia Institute of Technology, Atlanta, United States(佐治亚理工学院) ; Southeast University, Location, Country(东南大学) ; Tsinghua University(清华大学)
专题命中 数学推理 :reasoning(title,abstract);分类 cs.AI
AI总结 DyTopo通过语义匹配实现多智能体推理的动态拓扑路由,提升多轮推理性能并提供可解释的协调轨迹。
逐步压缩大型语言模型以像沸 frog 一样进行推理
机构 * Salesforce AI Research(Salesforce AI研究部) ; National University of Singapore(新加坡国立大学)
专题命中 数学推理 :reasoning(title,abstract);分类 cs.LG
AI总结 本文提出了一种渐进压缩方法,通过剪枝-微调循环逐步减少大型语言模型大小,同时保持推理性能,适用于多种剪枝策略和后期训练方法。
超越拒绝采样:轨迹融合用于扩展数学推理
机构 * Microsoft(微软)
专题命中 数学推理 :reasoning(title,abstract);分类 cs.CL
AI总结 TrajFusion通过融合错误与正确推理轨迹,改进数学推理微调,提升复杂问题表现。
从工具使用者到创作者的进化:通过无训练经验重用在多模态推理中
专题命中 数学推理 :reasoning(title,abstract);分类 cs.AI
AI总结 UCT框架通过无训练经验重用,使智能体从工具使用者转变为工具创造者,提升多模态推理能力。
并非所有偏好都同等重要:面向推理模型的稳定性感知与梯度高效对齐
机构 * Aerospace Information Research Institute, Chinese Academy of Sciences(中国科学院航空航天信息研究所) ; Baidu Inc.(百度公司) ; Department of Computer Science, University of Toronto(多伦多大学计算机科学系) ; School of Intelligence Science and Technology, Peking University(北京大学智能科学与技术学院)
专题命中 数学推理 :reasoning(title,abstract);分类 cs.AI
AI总结 SAGE通过动态框架提升推理模型对齐的稳定性与梯度效率,通过信噪比优化和稳定性感知评分函数实现更高效的训练。
ASTER: 基于工具集成扩展推理的代理扩展
机构 * National Key Laboratory for Novel Software Technology, Nanjing University, China(新型软件技术国家实验室) ; School of Artificial Intelligence, Nanjing University, China(人工智能学院) ; Department of Foundation Model, 2012 Labs, Huawei(基础模型部门) ; The Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳))
专题命中 数学推理 :reasoning(title,abstract);分类 cs.CL
AI总结 ASTER通过冷启动策略提升工具集成推理性能,实现长周期推理的高效扩展。
VTC-R1: 视觉-文本压缩用于高效长上下文推理
机构 * Nanyang Technical University(南洋技术大学) ; Alibaba Cloud Computing(阿里巴巴云计算)
专题命中 数学推理 :reasoning(title,abstract);分类 cs.CL
AI总结 VTC-R1通过视觉-文本压缩提升长上下文推理效率,实现3.4倍token压缩和2.7倍端到端延迟提升。
Comments Code: https://github.com/w-yibo/VTC-R1
FedMOA: 基于异质奖励的联邦GRPO用于个性化推理大语言模型
机构 * University of Maryland, College Park(马里兰大学 College Park 分校) ; Cisco Research(思科研究)
专题命中 数学推理 :reasoning(title,abstract);分类 cs.LG
AI总结 FedMOA是一种联邦GRPO框架,用于在异质奖励下实现个性化推理大语言模型的多目标对齐,通过自适应加权机制和任务感知聚合策略提升性能和个性化效果。
RIDE: 通过项目反应理论进行数学推理的难度演变扰动
机构 * East China Normal University(东华大学) ; The Hong Kong University of Science and Technology(香港科学与技术大学)
专题命中 数学推理 :reasoning(title,abstract);分类 cs.CL
AI总结 RIDE通过项目反应理论生成更具挑战性的数学问题,评估大型语言模型的数学推理能力,实验显示其性能下降21.73%,验证了评估方法的有效性。
RAudit: 一种用于大语言模型推理的盲审协议
机构 * Stanford University(斯坦福大学)
专题命中 数学推理 :reasoning(title,abstract);分类 cs.AI
AI总结 RAudit通过盲审协议检测大语言模型推理中的问题,揭示了四个导致模型不可靠的机制,挑战了能力与鲁棒性之间的关系。
Comments 24 pages, 21 tables, 3 figures
思考机器:在大语言模型时代中的数学推理
机构 * Department of Informatics--- Science and Engineering (DISI), University of Bologna(信息科学与工程系(DISI),博洛尼亚大学) ; Department of Philosophy, University Paris 1 Panthéon-Sorbonne(哲学系,巴黎第一大学)
专题命中 数学推理 :reasoning(title,abstract);分类 cs.AI
AI总结 本文探讨了大语言模型在数学推理中的现状,分析了传统数学与形式化数学的差异,以及证明合成与代码生成的对比,旨在明确当前系统的局限性并指出未来发展方向。
Journal ref Big Data and Cognitive Computing, 2026, 10(1), 38
MortalMATH: 评估推理目标与紧急情境之间的冲突
机构 * Univ. Lille(里尔大学) ; Univ. Lille, Inria, CNRS, Centrale Lille, UMR 9189 - CRIStAL(里尔大学)
专题命中 数学推理 :reasoning(title,abstract);分类 cs.CL
AI总结 MortalMATH研究了推理模型在紧急情境下的表现差异,发现通用模型能拒绝危险任务,而专门模型则忽视危险,导致安全风险。
MARO:从社交互动中学习更强的推理能力
机构 * College of Computer Science and Artificial Intelligence, Fudan University(计算机科学与人工智能学院,复旦大学)
专题命中 数学推理 :reasoning(title,abstract);分类 cs.AI
AI总结 MARO通过多智能体社交环境提升大语言模型的推理能力,解决稀疏信号、角色分布不均和环境不稳定问题,实验显示其在社交推理和跨任务迁移上的显著效果。
SymCode:通过可验证代码生成实现数学推理的神经符号方法
机构 * Portland State University(波特兰州立大学) ; ElastixAI
专题命中 数学推理 :reasoning(title,abstract);分类 cs.CL
AI总结 SymCode通过可验证代码生成实现数学推理,显著提升准确性并增强模型的透明度和可靠性。
Comments camera-ready EACL 2026 Findings
PhysicsMind: 为基础多模态大语言模型和世界模型中的物理推理和预测进行仿真与现实力学基准测试
机构 * Peking University(北京大学) ; Mohamed bin Zayed University of Artificial Intelligence(莫扎伊德大学人工智能学院) ; National University of Singapore(新加坡国立大学) ; University of North Carolina at Chapel Hill(北卡罗来纳大学教堂山分校) ; University of Science and Technology of China(中国科学技术大学) ; Cornell University(康奈尔大学) ; Hong Kong Polytechnic University(香港理工大学) ; City University of Hong Kong(香港城市大学)
专题命中 数学推理 :reasoning(title,abstract);分类 cs.AI
AI总结 PhysicsMind是一个结合现实和仿真环境的统一基准,用于评估基础多模态大语言模型和世界模型在物理推理和预测中的能力。
通过自适应前缀对齐实现长链推理蒸馏
机构 * School of Computer Science and Engineering, Northeastern University, China(东北大学计算机科学与工程学院) ; Department of Computer Science and Technology, Institute for AI, Tsinghua University, China(清华大学计算机科学与技术系) ; Alibaba Group, China(阿里巴巴集团)
专题命中 数学推理 :reasoning(title,abstract);分类 cs.CL
AI总结 通过自适应前缀对齐方法提升学生模型的推理能力,有效蒸馏教师生成的长推理轨迹。
通过基于工具的多跳表格问答任务探索大型语言模型的元级推理
机构 * School of Informatics University of Edinburgh(信息学院爱丁堡大学)
专题命中 数学推理 :reasoning(title,abstract);分类 cs.CL
AI总结 本文通过设计基于工具的多跳表格问答任务,探索大型语言模型的元级推理能力,发现其在任务分解和工具选择方面表现良好,但在数学运算和任务理解上存在不足。
ENTRA:基于熵的大型语言模型推理中的冗余避免
机构 * School of Computer Science, Guangdong University of Technology(广东工业大学计算机科学学院) ; Peng Cheng Laboratory(鹏城实验室) ; Carnegie Mellon University(卡内基梅隆大学) ; Mohamed bin Zayed University of Artificial Intelligence(穆罕默德·本·扎耶德人工智能大学)
专题命中 数学推理 :reasoning(title,abstract);分类 cs.AI
AI总结 ENTRA通过基于熵的训练框架减少大型语言模型的冗余推理,提升推理效率和准确性。
工具增强的策略优化:通过强化学习协同推理与自适应工具使用
专题命中 数学推理 :reasoning(title,abstract);分类 cs.AI
AI总结 TAPO通过强化学习整合多跳推理与自适应工具调用,提升模型在知识密集型和计算密集型任务中的性能。
EpiCaR: 了解未知对提高大语言模型的推理能力至关重要
机构 * Graduate School of Data Science, Seoul National University(数据科学研究生院,首尔国立大学) ; Department of Rural Systems Engineering, Seoul National University(农村系统工程系,首尔国立大学) ; Department of Aerospace Engineering, Seoul National University(航空航天工程系,首尔国立大学)
专题命中 数学推理 :reasoning(title,abstract);分类 cs.CL
AI总结 EpiCaR通过知识校准推理提升大语言模型的推理准确性和校准性,减少推理计算量。
ROI-Reasoning: 为推理的理性优化 via 预计算元认知
机构 * Gaoling School of Artificial Intelligence, Renmin University of China(中国人民大学人工智能学院)
专题命中 数学推理 :reasoning(title,abstract);分类 cs.AI
AI总结 ROI-Reasoning通过预计算元认知,为LLMs提供预算感知的理性优化,提升推理性能并减少计算资源浪费。
OThink-R1: 内在快速/缓慢思考模式切换以抑制过度推理
机构 * Zhejiang University(浙江大学) ; OPPO Research Institute(OPPO研究院)
专题命中 数学推理 :reasoning(title,abstract);分类 cs.AI
AI总结 OThink-R1通过整合快速和缓慢思考模式,实现自动模式切换,从而在减少token使用的同时保持高准确性。
Comments Under review
评估大语言模型在不常见数学竞赛问题上的推理能力
机构 * University of Missouri: Kansas City(密苏里大学:堪萨斯城)
专题命中 数学推理 :reasoning(title,abstract);分类 cs.AI
AI总结 本研究评估了三种LLM在不常见数学竞赛问题上的推理能力,发现DeepSeek-V3在微积分、解析几何和离散数学中表现最佳,但所有模型在几何学上均表现较弱。
Comments 7 pages, submitted to ACM Transactions on Intelligent Systems and Technology
DaGRPO:通过意识性群相对策略优化纠正推理中的梯度冲突
专题命中 数学推理 :reasoning(title,abstract);分类 cs.AI
AI总结 DaGRPO通过意识性群相对策略优化纠正推理中的梯度冲突,提升推理能力和样本效率。
TIM-PRM:利用工具集成PRM验证多模态推理
机构 * Zhejiang University(浙江大学) ; iFLYTEK AI Research Institute(iFLYTEK人工智能研究院) ; City University of Hong Kong(香港城市大学)
专题命中 数学推理 :reasoning(title,abstract);分类 cs.AI
AI总结 TIM-PRM通过工具集成PRM验证多模态推理,有效解决视觉幻觉和逻辑不一致问题,实验表明其在性能和可解释性上优于现有模型。
Comments 12 pages
薛定谔AI:一种用于分类、推理和基于算子的泛化统一频谱-动态框架
机构 * Arizona State University(亚利桑那州立大学)
专题命中 数学推理 :reasoning(title,abstract);分类 cs.LG
AI总结 薛定谔AI通过统一频谱-动态框架实现分类、推理和基于算子的泛化,提供稳健的泛化能力与可解释的语义。
Leash:自适应长度惩罚与奖励塑造用于高效大推理模型
机构 * Peking University(北京大学) ; Harbin Institute of Technology(哈尔滨工业大学)
专题命中 数学推理 :reasoning(title,abstract);分类 cs.AI
AI总结 Leash通过自适应长度惩罚与奖励塑造,有效提升大模型推理效率,减少推理长度60%同时保持性能竞争力。
Vibe Reasoning: 引导前沿AI数学能力——以IMO 2025问题6的案例研究
机构 * Tsinghua University(清华大学) ; Microsoft Research(微软研究院)
专题命中 数学推理 :reasoning(title,abstract);分类 cs.AI
AI总结 Vibe Reasoning通过结合AI与人类协作,利用元提示和代理编排解决复杂数学问题,展示了前沿AI在组合优化中的应用与改进。
Comments 20 pages, 13 figures
工具增强的混合集成推理与蒸馏用于双语数学问题求解
机构 * Boston University(波士顿大学) ; University of Pennsylvania(宾夕法尼亚大学) ; Northwestern University(西北大学) ; University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校)
专题命中 数学推理 :reasoning(title,abstract);分类 cs.AI
AI总结 HERALD通过结合自适应学习、工具强化学习和知识蒸馏,提升双语数学问题求解的准确性和稳定性。