Tool-Augmented Policy Optimization: Synergizing Reasoning and Adaptive Tool Use with Reinforcement Learning
工具增强的策略优化:通过强化学习协同推理与自适应工具使用
专题命中 数学推理 :reasoning(title,abstract);分类 cs.AI
AI总结 TAPO通过强化学习整合多跳推理与自适应工具调用,提升模型在知识密集型和计算密集型任务中的性能。
AI 大模型
大模型数学、逻辑、规划、多步推理和测试时计算能力。
工具增强的策略优化:通过强化学习协同推理与自适应工具使用
专题命中 数学推理 :reasoning(title,abstract);分类 cs.AI
AI总结 TAPO通过强化学习整合多跳推理与自适应工具调用,提升模型在知识密集型和计算密集型任务中的性能。
EpiCaR: 了解未知对提高大语言模型的推理能力至关重要
机构 * Graduate School of Data Science, Seoul National University(数据科学研究生院,首尔国立大学) ; Department of Rural Systems Engineering, Seoul National University(农村系统工程系,首尔国立大学) ; Department of Aerospace Engineering, Seoul National University(航空航天工程系,首尔国立大学)
专题命中 数学推理 :reasoning(title,abstract);分类 cs.CL
AI总结 EpiCaR通过知识校准推理提升大语言模型的推理准确性和校准性,减少推理计算量。
ROI-Reasoning: 为推理的理性优化 via 预计算元认知
机构 * Gaoling School of Artificial Intelligence, Renmin University of China(中国人民大学人工智能学院)
专题命中 数学推理 :reasoning(title,abstract);分类 cs.AI
AI总结 ROI-Reasoning通过预计算元认知,为LLMs提供预算感知的理性优化,提升推理性能并减少计算资源浪费。
OThink-R1: 内在快速/缓慢思考模式切换以抑制过度推理
机构 * Zhejiang University(浙江大学) ; OPPO Research Institute(OPPO研究院)
专题命中 数学推理 :reasoning(title,abstract);分类 cs.AI
AI总结 OThink-R1通过整合快速和缓慢思考模式,实现自动模式切换,从而在减少token使用的同时保持高准确性。
Comments Under review
评估大语言模型在不常见数学竞赛问题上的推理能力
机构 * University of Missouri: Kansas City(密苏里大学:堪萨斯城)
专题命中 数学推理 :reasoning(title,abstract);分类 cs.AI
AI总结 本研究评估了三种LLM在不常见数学竞赛问题上的推理能力,发现DeepSeek-V3在微积分、解析几何和离散数学中表现最佳,但所有模型在几何学上均表现较弱。
Comments 7 pages, submitted to ACM Transactions on Intelligent Systems and Technology
DaGRPO:通过意识性群相对策略优化纠正推理中的梯度冲突
专题命中 数学推理 :reasoning(title,abstract);分类 cs.AI
AI总结 DaGRPO通过意识性群相对策略优化纠正推理中的梯度冲突,提升推理能力和样本效率。
TIM-PRM:利用工具集成PRM验证多模态推理
机构 * Zhejiang University(浙江大学) ; iFLYTEK AI Research Institute(iFLYTEK人工智能研究院) ; City University of Hong Kong(香港城市大学)
专题命中 数学推理 :reasoning(title,abstract);分类 cs.AI
AI总结 TIM-PRM通过工具集成PRM验证多模态推理,有效解决视觉幻觉和逻辑不一致问题,实验表明其在性能和可解释性上优于现有模型。
Comments 12 pages
薛定谔AI:一种用于分类、推理和基于算子的泛化统一频谱-动态框架
机构 * Arizona State University(亚利桑那州立大学)
专题命中 数学推理 :reasoning(title,abstract);分类 cs.LG
AI总结 薛定谔AI通过统一频谱-动态框架实现分类、推理和基于算子的泛化,提供稳健的泛化能力与可解释的语义。
Leash:自适应长度惩罚与奖励塑造用于高效大推理模型
机构 * Peking University(北京大学) ; Harbin Institute of Technology(哈尔滨工业大学)
专题命中 数学推理 :reasoning(title,abstract);分类 cs.AI
AI总结 Leash通过自适应长度惩罚与奖励塑造,有效提升大模型推理效率,减少推理长度60%同时保持性能竞争力。
Vibe Reasoning: 引导前沿AI数学能力——以IMO 2025问题6的案例研究
机构 * Tsinghua University(清华大学) ; Microsoft Research(微软研究院)
专题命中 数学推理 :reasoning(title,abstract);分类 cs.AI
AI总结 Vibe Reasoning通过结合AI与人类协作,利用元提示和代理编排解决复杂数学问题,展示了前沿AI在组合优化中的应用与改进。
Comments 20 pages, 13 figures
工具增强的混合集成推理与蒸馏用于双语数学问题求解
机构 * Boston University(波士顿大学) ; University of Pennsylvania(宾夕法尼亚大学) ; Northwestern University(西北大学) ; University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校)
专题命中 数学推理 :reasoning(title,abstract);分类 cs.AI
AI总结 HERALD通过结合自适应学习、工具强化学习和知识蒸馏,提升双语数学问题求解的准确性和稳定性。
Nemotron-Math:基于多模式监督的高效长上下文数学推理蒸馏
专题命中 数学推理 :reasoning(title,abstract);分类 cs.AI
AI总结 Nemotron-Math通过多模式监督和长上下文训练,实现了高效数学推理蒸馏,显著提升数学竞赛任务的性能。
评估前沿大语言模型在博士级数学推理中的表现:一个关于随机算法理论教材的基准测试
专题命中 数学推理 :reasoning(title,abstract);分类 cs.AI
AI总结 本文评估了前沿大语言模型在博士级数学推理中的表现,通过随机算法教材的基准测试,发现顶级模型在准确性上表现优异,但可靠性存在显著差异。
从模仿到辨别:一种通用的课程优势机制,增强跨领域推理任务
机构 * \equalcontrib(1号机构)
专题命中 数学推理 :reasoning(title,abstract);分类 cs.CL
AI总结 CAPO是一种基于优势信号的自适应课程机制,通过引导模仿学习和引入负信号提升跨领域推理任务的泛化能力。
Comments Accepted by AAAI 2026
TRACE:一种用于分析和增强视觉-语言模型逐步推理的框架
机构 * Meta Reality Lab(Meta现实实验室)
专题命中 数学推理 :reasoning(title,abstract);分类 cs.AI
AI总结 TRACE通过辅助推理集和一致性评估,提升视觉-语言模型的推理透明性和错误检测能力,促进模型改进和优化。
数学证明作为检验标准:揭示先进大推理模型的失败模式
机构 * Hong Kong University of Science and Technology(香港科技大学)
专题命中 数学推理 :reasoning(title,abstract);分类 cs.AI
AI总结 本文通过引入RFMDataset揭示大推理模型在数学证明中的失败模式,发现其在严谨性和正确性上的不足,需进一步提升逻辑训练。
量子电路推理模型:一种用于可微逻辑推理的变分框架
机构 * UC Berkeley, School of Information(伯克利大学信息学院)
专题命中 数学推理 :reasoning(title,abstract);分类 cs.AI
AI总结 量子电路推理模型通过变分框架实现可微逻辑推理,将量子力学操作映射到推理原语,用于科学、生物医学和化学领域的推理任务。
通过误导性训练探索大型语言模型的隐藏推理过程
机构 * Department of Automation, Tsinghua University(自动化系,清华大学) ; College of Computer and Cyber Security, Fujian Normal University(计算机与网络安全学院,福建师范大学)
专题命中 数学推理 :reasoning(title,abstract);分类 cs.LG
AI总结 本文通过误导性训练方法探索LLMs的隐藏推理过程,发现其具备在任务抽象前进行推理的内部机制。
无需运行即可计数:评估LLM对代码复杂度的推理能力
专题命中 数学推理 :reasoning(title,abstract);分类 cs.AI
AI总结 本文提出gpuFLOPBench基准测试,评估LLM在无需运行代码的情况下预测CUDA内核FLOP计数的能力,揭示现有代码助手在硬件特定微码效应方面的局限性。
Comments 13 pages, 6 figures, MLSys 2026 Submission
捉摸不到:为何小型推理模型用数学严谨性伪装推理
专题命中 数学推理 :reasoning(title,abstract);分类 cs.CL
AI总结 该研究提出诊断框架,揭示小型模型依赖模式匹配而非真实逻辑计算,通过四个轴线评估推理忠实性,推动可验证的数学推理研究。
Comments 8 pages, 5 figures. A preprint. Initial Work
RLVR在数学推理中的泛化极限:两个案例研究
机构 * Rochester Institute of Technology(罗切斯特理工学院)
专题命中 数学推理 :reasoning(title,abstract);分类 cs.LG
AI总结 RLVR在数学推理任务中通过强化表面启发式方法提升指标,但难以获得真实推理策略,凸显其泛化能力的局限性。
学习推理:通过GPT-OSS或DeepSeek R1推理轨迹训练LLMs
机构 * DICTA ; NVIDIA
专题命中 数学推理 :reasoning(title,abstract);分类 cs.CL
AI总结 本研究通过比较DeepSeek-R1和gpt-oss生成的推理轨迹对中型LLMs在数学问题上的微调效果,评估了推理轨迹在提升模型推理能力中的作用。
通过模型合并实现高效的多模态统一推理模型
机构 * Beijing University of Posts and Telecommunications(北京邮电大学) ; Nanyang Technological University(南洋理工大学) ; Beijing Key Laboratory of Network System and Network Culture(北京网络系统与网络文化重点实验室) ; Key Laboratory of Interactive Technology and Experience System, Ministry of Culture and Tourism(文化和旅游部交互技术与体验系统重点实验室) ; Zhongguancun Academy, Beijing, China(中关村学院,北京,中国)
专题命中 数学推理 :reasoning(title,abstract);分类 cs.AI
AI总结 Tiny-R1V通过两阶段优化和模型合并方法,实现高效多模态推理,提升轻量模型在多种任务中的性能。
Comments Technical report, Code will be available at https://github.com/buptyqx/Tiny-R1V
机构 * University of Chinese Academy of Sciences(中国科学院大学) ; The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州)) ; SCITIX (SGP) TECH PTE. LTD.(SCITIX(SGP)技术有限公司) ; Max Planck Institute for Intelligent Systems(智能系统马克斯·普朗克研究所) ; ELLIS Institute Tübingen(图宾根ELLIS研究所) ; Tübingen AI Center(图宾根人工智能中心)
专题命中 数学推理 :reasoning(title,abstract);分类 cs.AI
Comments Under Review
机构 * Berkeley AI Safety Initiative (BASIS) UC Berkeley(伯克利人工智能安全计划(BASIS)加州大学伯克利分校)
专题命中 数学推理 :reasoning(title,abstract);分类 cs.LG
Comments Paper accepted to the 2nd Workshop on Aligning Reinforcement Learning Experimentalists and Theorists (ARLET 2025) at NeurIPS; the paper consists of 14 pages (including the appendix) and contains 3 figures
机构 * City University of Hong Kong(香港城市大学) ; Huawei Research(华为研究)
专题命中 数学推理 :reasoning(title,abstract);分类 cs.AI
机构 * The Chinese University of Hong Kong(香港中文大学) ; Huawei Noah’s Ark Lab(华为诺亚实验室) ; The University of Hong Kong(香港大学)
专题命中 数学推理 :reasoning(title,abstract);分类 cs.CL
Comments under review
机构 * Xi’an Jiaotong University(西安交通大学) ; SGIT AI Lab(SGIT人工智能实验室)
专题命中 数学推理 :reasoning(title,abstract);分类 cs.AI
专题命中 数学推理 :reasoning(title,abstract);分类 cs.AI
机构 * McGill University(麦吉尔大学) ; Mila - Quebec AI Institute(魁北克AI研究所) ; Int. Lab. Learning Systems(国际学习系统实验室) ; Huawei Montréal, Canada(华为蒙特利尔加拿大分公司)
专题命中 数学推理 :reasoning(title,abstract);分类 cs.LG