AStar: Boosting Multimodal Reasoning with Automated Structured Thinking
AStar: 通过自动化结构化思维提升多模态推理
专题命中 数学推理 :reasoning(title,abstract);分类 cs.CL
AI总结 AStar通过自动化结构化思维提升多模态推理效率,实现更高准确率和更强迁移能力。
Comments Accepted by AAAI 2026 Oral
AI 大模型
大模型数学、逻辑、规划、多步推理和测试时计算能力。
AStar: 通过自动化结构化思维提升多模态推理
专题命中 数学推理 :reasoning(title,abstract);分类 cs.CL
AI总结 AStar通过自动化结构化思维提升多模态推理效率,实现更高准确率和更强迁移能力。
Comments Accepted by AAAI 2026 Oral
提升推理语言模型的参数知识访问能力
机构 * Columbia University(哥伦比亚大学)
专题命中 数学推理 :reasoning(title,abstract);分类 cs.CL
AI总结 通过强化学习训练,提升推理语言模型在参数知识访问上的能力,改进知识回忆和问答任务表现。
推理模型差分的转码适配器
机构 * Stanford University(斯坦福大学)
专题命中 数学推理 :reasoning(title,abstract);分类 cs.LG
AI总结 转码适配器用于分析推理模型微调前后的差异,揭示了推理训练对模型内部机制的影响,并展示了适配器在恢复推理准确性方面的有效性。
Comments 9 pages main, 27 pages total, 10 figures. Code and visualizations at https://transcoder-adapters.github.io/
CogFlow:通过知识内化连接感知与推理以解决视觉数学问题
机构 * Zhejiang University(浙江大学) ; Intelligent Learning(智能学习) ; Sichuan University(四川大学) ; Tsinghua University(清华大学)
专题命中 数学推理 :reasoning(title,abstract);分类 cs.AI
AI总结 CogFlow通过知识内化连接感知与推理,提升视觉数学问题解决能力。
Comments Accepted to ICLR 2026
RPU -- 一种推理处理单元
专题命中 数学推理 :reasoning(title,abstract);分类 cs.AI
AI总结 RPU通过优化内存带宽和架构设计,显著提升了大型语言模型推理的性能和效率。
Comments To Appear in HPCA, 2026
LAD: 为推理学习优势分布
专题命中 数学推理 :reasoning(title,abstract);分类 cs.LG
AI总结 LAD通过学习优势分布提升大型模型推理的多样性和准确性,无需额外训练成本。
QiMeng-CodeV-R1: 基于推理增强的Verilog生成
机构 * State Key Lab of Processors, Institute of Computing Technology, CAS(处理器国家重点实验室,计算技术研究所,中国科学院)
专题命中 数学推理 :reasoning(title,abstract);分类 cs.LG
AI总结 QiMeng-CodeV-R1通过改进的RLVR框架,实现了基于推理增强的Verilog生成,提升了硬件描述语言生成的准确性和效率。
RV-Syn: 基于结构化函数库的理性且可验证的数学推理数据合成
机构 * Gaoling School of Artificial Intelligence, Renmin University of China(中国人民大学人工智能学院) ; Ant Group(蚂蚁集团) ; Beijing Key Laboratory of Research on Large Models and Intelligent Governance(北京大型模型与智能治理重点实验室)
专题命中 数学推理 :reasoning(title,abstract);分类 cs.AI
AI总结 RV-Syn通过结构化函数库生成可验证的数学推理数据,提升数据质量和生成效率。
Comments Accepted to EACL 2026
PACE: 用于高效推理的前缀保护和难度感知压缩
机构 * University of Electronic Science and Technology of China(电子科技大学) ; Nanbeige Lab, BOSS Zhipin(纳米贝实验室,BOSS智联) ; Peking University(北京大学)
专题命中 数学推理 :reasoning(title,abstract);分类 cs.CL
AI总结 PACE通过双层框架实现前缀保护和难度感知压缩,有效减少token使用并提升推理准确性。
Transformer在离散推理中的障碍:深度、精确性与带宽的跨领域综述
机构 * Oracle AI
专题命中 数学推理 :reasoning(title,abstract);分类 cs.CL
AI总结 本文综述了Transformer在离散推理任务中的理论限制,从电路复杂度、近似理论和通信复杂度三个角度分析了深度、精确性和带宽等障碍,并探讨了模型设计的改进方向。
Comments Accepted to EACL 2026 Main Conference
通过群体扩散策略优化提升扩散语言模型的推理能力
机构 * Georgia Institute of Technology(佐治亚理工学院) ; ML Research, Morgan Stanley(摩根士丹利机器学习研究部)
专题命中 数学推理 :reasoning(title,abstract);分类 cs.LG
AI总结 本文提出GDPO算法,通过减少ELBO估计的方差提升扩散语言模型的推理能力,实验证明其在多个基准上优于现有方法。
iGRPO:基于自我反馈的LLM推理
机构 * NVIDIA(英伟达)
专题命中 数学推理 :reasoning(title,abstract);分类 cs.AI
AI总结 iGRPO通过动态自我条件和两阶段优化,提升LLM在数学推理任务中的表现,实现更准确和一致的解决方案。
Comments Tech report
DyTopo:通过语义匹配实现多智能体推理的动态拓扑路由
机构 * Peking University, Beijing, China(北京大学) ; Georgia Institute of Technology, Atlanta, United States(佐治亚理工学院) ; Southeast University, Location, Country(东南大学) ; Tsinghua University(清华大学)
专题命中 数学推理 :reasoning(title,abstract);分类 cs.AI
AI总结 DyTopo通过语义匹配实现多智能体推理的动态拓扑路由,提升多轮推理性能并提供可解释的协调轨迹。
逐步压缩大型语言模型以像沸 frog 一样进行推理
机构 * Salesforce AI Research(Salesforce AI研究部) ; National University of Singapore(新加坡国立大学)
专题命中 数学推理 :reasoning(title,abstract);分类 cs.LG
AI总结 本文提出了一种渐进压缩方法,通过剪枝-微调循环逐步减少大型语言模型大小,同时保持推理性能,适用于多种剪枝策略和后期训练方法。
超越拒绝采样:轨迹融合用于扩展数学推理
机构 * Microsoft(微软)
专题命中 数学推理 :reasoning(title,abstract);分类 cs.CL
AI总结 TrajFusion通过融合错误与正确推理轨迹,改进数学推理微调,提升复杂问题表现。
从工具使用者到创作者的进化:通过无训练经验重用在多模态推理中
专题命中 数学推理 :reasoning(title,abstract);分类 cs.AI
AI总结 UCT框架通过无训练经验重用,使智能体从工具使用者转变为工具创造者,提升多模态推理能力。
并非所有偏好都同等重要:面向推理模型的稳定性感知与梯度高效对齐
机构 * Aerospace Information Research Institute, Chinese Academy of Sciences(中国科学院航空航天信息研究所) ; Baidu Inc.(百度公司) ; Department of Computer Science, University of Toronto(多伦多大学计算机科学系) ; School of Intelligence Science and Technology, Peking University(北京大学智能科学与技术学院)
专题命中 数学推理 :reasoning(title,abstract);分类 cs.AI
AI总结 SAGE通过动态框架提升推理模型对齐的稳定性与梯度效率,通过信噪比优化和稳定性感知评分函数实现更高效的训练。
ASTER: 基于工具集成扩展推理的代理扩展
机构 * National Key Laboratory for Novel Software Technology, Nanjing University, China(新型软件技术国家实验室) ; School of Artificial Intelligence, Nanjing University, China(人工智能学院) ; Department of Foundation Model, 2012 Labs, Huawei(基础模型部门) ; The Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳))
专题命中 数学推理 :reasoning(title,abstract);分类 cs.CL
AI总结 ASTER通过冷启动策略提升工具集成推理性能,实现长周期推理的高效扩展。
VTC-R1: 视觉-文本压缩用于高效长上下文推理
机构 * Nanyang Technical University(南洋技术大学) ; Alibaba Cloud Computing(阿里巴巴云计算)
专题命中 数学推理 :reasoning(title,abstract);分类 cs.CL
AI总结 VTC-R1通过视觉-文本压缩提升长上下文推理效率,实现3.4倍token压缩和2.7倍端到端延迟提升。
Comments Code: https://github.com/w-yibo/VTC-R1
FedMOA: 基于异质奖励的联邦GRPO用于个性化推理大语言模型
机构 * University of Maryland, College Park(马里兰大学 College Park 分校) ; Cisco Research(思科研究)
专题命中 数学推理 :reasoning(title,abstract);分类 cs.LG
AI总结 FedMOA是一种联邦GRPO框架,用于在异质奖励下实现个性化推理大语言模型的多目标对齐,通过自适应加权机制和任务感知聚合策略提升性能和个性化效果。
RIDE: 通过项目反应理论进行数学推理的难度演变扰动
机构 * East China Normal University(东华大学) ; The Hong Kong University of Science and Technology(香港科学与技术大学)
专题命中 数学推理 :reasoning(title,abstract);分类 cs.CL
AI总结 RIDE通过项目反应理论生成更具挑战性的数学问题,评估大型语言模型的数学推理能力,实验显示其性能下降21.73%,验证了评估方法的有效性。
RAudit: 一种用于大语言模型推理的盲审协议
机构 * Stanford University(斯坦福大学)
专题命中 数学推理 :reasoning(title,abstract);分类 cs.AI
AI总结 RAudit通过盲审协议检测大语言模型推理中的问题,揭示了四个导致模型不可靠的机制,挑战了能力与鲁棒性之间的关系。
Comments 24 pages, 21 tables, 3 figures
思考机器:在大语言模型时代中的数学推理
机构 * Department of Informatics--- Science and Engineering (DISI), University of Bologna(信息科学与工程系(DISI),博洛尼亚大学) ; Department of Philosophy, University Paris 1 Panthéon-Sorbonne(哲学系,巴黎第一大学)
专题命中 数学推理 :reasoning(title,abstract);分类 cs.AI
AI总结 本文探讨了大语言模型在数学推理中的现状,分析了传统数学与形式化数学的差异,以及证明合成与代码生成的对比,旨在明确当前系统的局限性并指出未来发展方向。
Journal ref Big Data and Cognitive Computing, 2026, 10(1), 38
MortalMATH: 评估推理目标与紧急情境之间的冲突
机构 * Univ. Lille(里尔大学) ; Univ. Lille, Inria, CNRS, Centrale Lille, UMR 9189 - CRIStAL(里尔大学)
专题命中 数学推理 :reasoning(title,abstract);分类 cs.CL
AI总结 MortalMATH研究了推理模型在紧急情境下的表现差异,发现通用模型能拒绝危险任务,而专门模型则忽视危险,导致安全风险。
MARO:从社交互动中学习更强的推理能力
机构 * College of Computer Science and Artificial Intelligence, Fudan University(计算机科学与人工智能学院,复旦大学)
专题命中 数学推理 :reasoning(title,abstract);分类 cs.AI
AI总结 MARO通过多智能体社交环境提升大语言模型的推理能力,解决稀疏信号、角色分布不均和环境不稳定问题,实验显示其在社交推理和跨任务迁移上的显著效果。
SymCode:通过可验证代码生成实现数学推理的神经符号方法
机构 * Portland State University(波特兰州立大学) ; ElastixAI
专题命中 数学推理 :reasoning(title,abstract);分类 cs.CL
AI总结 SymCode通过可验证代码生成实现数学推理,显著提升准确性并增强模型的透明度和可靠性。
Comments camera-ready EACL 2026 Findings
PhysicsMind: 为基础多模态大语言模型和世界模型中的物理推理和预测进行仿真与现实力学基准测试
机构 * Peking University(北京大学) ; Mohamed bin Zayed University of Artificial Intelligence(莫扎伊德大学人工智能学院) ; National University of Singapore(新加坡国立大学) ; University of North Carolina at Chapel Hill(北卡罗来纳大学教堂山分校) ; University of Science and Technology of China(中国科学技术大学) ; Cornell University(康奈尔大学) ; Hong Kong Polytechnic University(香港理工大学) ; City University of Hong Kong(香港城市大学)
专题命中 数学推理 :reasoning(title,abstract);分类 cs.AI
AI总结 PhysicsMind是一个结合现实和仿真环境的统一基准,用于评估基础多模态大语言模型和世界模型在物理推理和预测中的能力。
通过自适应前缀对齐实现长链推理蒸馏
机构 * School of Computer Science and Engineering, Northeastern University, China(东北大学计算机科学与工程学院) ; Department of Computer Science and Technology, Institute for AI, Tsinghua University, China(清华大学计算机科学与技术系) ; Alibaba Group, China(阿里巴巴集团)
专题命中 数学推理 :reasoning(title,abstract);分类 cs.CL
AI总结 通过自适应前缀对齐方法提升学生模型的推理能力,有效蒸馏教师生成的长推理轨迹。
通过基于工具的多跳表格问答任务探索大型语言模型的元级推理
机构 * School of Informatics University of Edinburgh(信息学院爱丁堡大学)
专题命中 数学推理 :reasoning(title,abstract);分类 cs.CL
AI总结 本文通过设计基于工具的多跳表格问答任务,探索大型语言模型的元级推理能力,发现其在任务分解和工具选择方面表现良好,但在数学运算和任务理解上存在不足。
ENTRA:基于熵的大型语言模型推理中的冗余避免
机构 * School of Computer Science, Guangdong University of Technology(广东工业大学计算机科学学院) ; Peng Cheng Laboratory(鹏城实验室) ; Carnegie Mellon University(卡内基梅隆大学) ; Mohamed bin Zayed University of Artificial Intelligence(穆罕默德·本·扎耶德人工智能大学)
专题命中 数学推理 :reasoning(title,abstract);分类 cs.AI
AI总结 ENTRA通过基于熵的训练框架减少大型语言模型的冗余推理,提升推理效率和准确性。