arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型推理能力

大模型数学、逻辑、规划、多步推理和测试时计算能力。

共收录 3240 信号源:cs.CL, cs.AI, cs.LG

1. 数学推理 3240 篇

2309.17446 2023-10-03 cs.CL cs.LG cs.PL cs.SE 73%

L2CEval: Evaluating Language-to-Code Generation Capabilities of Large Language Models

Ansong Ni, Pengcheng Yin, Yilun Zhao, Martin Riddell, Troy Feng, Rui Shen, Stephen Yin, Ye Liu, Semih Yavuz, Caiming Xiong, Shafiq Joty, Yingbo Zhou, Dragomir Radev, Arman Cohan

专题命中 数学推理 :reasoning(abstract);math reasoning(abstract);分类 cs.CL、cs.LG

Comments Project Website: https://l2c-eval.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2310.00272 2023-10-03 cs.CL cs.AI 73%

Investigating the Efficacy of Large Language Models in Reflective Assessment Methods through Chain of Thoughts Prompting

Baphumelele Masikisiki, Vukosi Marivate, Yvette Hlope

专题命中 数学推理 :reasoning(abstract);CoT(abstract);分类 cs.CL、cs.AI

Comments Accepted for publication in the Associate Computer Machinery

详情

展开后加载摘要…

URL PDF HTML 收藏
2308.07921 2023-08-16 cs.CL cs.AI cs.CV 73%

Solving Challenging Math Word Problems Using GPT-4 Code Interpreter with Code-based Self-Verification

Aojun Zhou, Ke Wang, Zimu Lu, Weikang Shi, Sichun Luo, Zipeng Qin, Shaoqing Lu, Anya Jia, Linqi Song, Mingjie Zhan, Hongsheng Li

专题命中 数学推理 :reasoning(abstract);math reasoning(abstract);分类 cs.CL、cs.AI

Comments Solving Challenging Math Word Problems Using GPT-4 Code Interpreter with Code-based Self-Verification

详情

展开后加载摘要…

URL PDF HTML 收藏
2304.11107 2023-04-24 cs.CL cs.AI 73%

ChatABL: Abductive Learning via Natural Language Interaction with ChatGPT

Tianyang Zhong, Yaonai Wei, Li Yang, Zihao Wu, Zhengliang Liu, Xiaozheng Wei, Wenjun Li, Junjie Yao, Chong Ma, Xiang Li, Dajiang Zhu, Xi Jiang, Junwei Han, Dinggang Shen, Tianming Liu, Tuo Zhang

专题命中 数学推理 :reasoning(abstract);logical reasoning(abstract);分类 cs.CL、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2211.10435 2023-01-30 cs.CL cs.AI 73%

PAL: Program-aided Language Models

Luyu Gao, Aman Madaan, Shuyan Zhou, Uri Alon, Pengfei Liu, Yiming Yang, Jamie Callan, Graham Neubig

专题命中 数学推理 :reasoning(abstract);chain-of-thought(abstract);分类 cs.CL、cs.AI

Comments The first three authors contributed equally. Our code and data are publicly available at http://reasonwithpal.com/

详情

展开后加载摘要…

URL PDF HTML 收藏
2110.14168 2021-11-19 cs.LG cs.CL 73%

Training Verifiers to Solve Math Word Problems

Karl Cobbe, Vineet Kosaraju, Mohammad Bavarian, Mark Chen, Heewoo Jun, Lukasz Kaiser, Matthias Plappert, Jerry Tworek, Jacob Hilton, Reiichiro Nakano, Christopher Hesse, John Schulman

专题命中 数学推理 :reasoning(abstract);verifier(abstract);分类 cs.CL、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2208.13961 2022-08-31 eess.SY cs.SY 71%

Mathematical certification of motion planning on uncertain terrain with limited perception: a case study

Nikolaos Skouloudis, Alexandre Megretski

专题命中 数学推理 :planning(title)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.23200 2026-08-25 cs.CL 新提交 70%

LongWoF-Bench: Evaluating EvoMap Genes for Verifiable Long-Workflow Tasks

LongWoF-Bench:评估用于可验证长工作流任务的EvoMap基因

Xiao Zhang, Qumeng Sun, Jihao Li, Yiming Ren, Xiang Liu, Haoyang Zhang, Junjie Wang

机构 * EvoMap Tsinghua University(清华大学)

专题命中 数学推理 :reasoning(abstract);verifier(abstract);分类 cs.CL

AI总结 该研究提出LongWoF-Bench基准,发现通过EvoMap将验证的执行轨迹转化为可复用的Gene,能显著提升多模型在长工作流任务上的表现,且优于Skill和参考蒸馏的Gene。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.19802 2026-08-21 cs.CL 新提交 70%

Stopping and Routing LLM Judge Panels

停止与路由大语言模型(LLM)评审小组

Bin Zhu, Yi Xie, Yanghui Rao

机构 * School of Computer Science and Engineering(计算机科学与工程学院) Sun Yat-sen University(中山大学)

专题命中 数学推理 :reasoning(abstract);verifier(abstract);分类 cs.CL

AI总结 该研究将LLM评审小组设计建模为角色条件分配问题,提出策略优化评审调用,经多类审计对比,生成可复用的评审调用计划。

Comments 21 pages, 2 figures, 20 tables. Accepted at WISE 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.13317 2026-08-14 cs.AI 新提交 70%

StateBridge: Training-free Hidden-state Alignment for Latent Communication in LLM Multi-Agent Systems

StateBridge:面向大语言模型多智能体系统潜在通信的无训练隐藏状态对齐

Yanwen Peng, Delvin Ce Zhang, Xi Wang, Nikolaos Aletras

机构 * School of Computer Science, University of Sheffield(谢菲尔德大学计算机科学学院)

专题命中 数学推理 :reasoning(abstract);math reasoning(abstract);分类 cs.AI

AI总结 StateBridge 是一种无训练的潜在通信方法,通过闭式正交变换对齐大语言模型多智能体的隐藏状态,在 26 个模型-任务对中 22 个取得最优或并列最优性能,优于基线。

Comments 18 pages, 3 figures, 4 tables, accepted by COLM2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.08964 2026-08-11 cs.LG 新提交 70%

Math-Vision Diagrams: A Comprehensive Benchmark for Evaluating LLM Mathematical Diagram Generation Capabilities

数学视觉图表:评估大型语言模型数学图表生成能力的综合基准

Harish Kashyap, Kiran Byadarhaly, Sriram Chakaravarthy, Sanyukta Tuti, Aryan Mistry

机构 * Pandita AI Inc.(潘迪塔人工智能公司)

专题命中 数学推理 :reasoning(abstract);math reasoning(abstract);分类 cs.LG

AI总结 本研究推出首个专门评估LLMs数学图表生成能力的基准Math-Vision Diagrams,涵盖文本到代码与图像范式,测试发现LLMs在该任务上存在困难,相关资源将开源。

Comments Accepted at ICANN 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.04439 2026-08-06 cs.SE cs.AI 新提交 70%

ExeCRE: Execution-Consistency Guided Reliability Estimation for Self-Correcting Code Generation

ExeCRE:基于执行一致性引导的自校正代码生成可靠性估计

Yiru Dong, Richong Zhang, Fanshuang Kong, Si Chen

专题命中 数学推理 :reasoning(abstract);self-correction(abstract);分类 cs.AI

AI总结 ExeCRE是基于执行一致性的代码可靠性估计框架,可减少自校正代码生成中的误导性反馈,提升有效性与稳定性,在GPT-5.2搭配LiveCodeBench及数学推理场景均有显著收益。

Comments 13 pages, 5 figures. Accepted at the 41st IEEE/ACM International Conference on Automated Software Engineering (ASE 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.26644 2026-08-04 cs.AI 版本更新 70%

When to Vote, When to Rewrite: Disagreement-Guided Strategy Routing for Test-Time Scaling

何时投票,何时重写:基于分歧的策略路由用于测试时扩展

Zhimin Lin, Yixin Ji, Jinpeng Li, Yu Luo, Dong Li, Junhua Fang, Juntao Li, Min Zhang

机构 * School of Computer Science and Technology, Soochow University(苏州大学计算机科学与技术学院) Department of Foundation Model, 2012 Labs, Huawei(华为2012实验室基础模型部门) Harbin Institute of Technology, Shenzhen (HITSZ)(哈尔滨工业大学深圳(哈工大深圳))

专题命中 数学推理 :reasoning(abstract);self-correction(abstract);分类 cs.AI

AI总结 本文提出基于输出分歧的策略路由方法,通过动态选择不同扩展策略提升数学推理任务的准确性,减少计算成本。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.20372 2026-07-23 cs.CL 新提交 70%

Notes to Self: Can LLMs Benefit from Experiential Abstractions?

给自己的笔记:大语言模型能从经验抽象中受益吗?

Chang Liu, Xinyu Li, Artur Dubrawski

机构 * Auton Lab, Carnegie Mellon University(卡内基梅隆大学自动实验室)

专题命中 数学推理 :reasoning(abstract);logical reasoning(abstract);分类 cs.CL

AI总结 研究大语言模型能否从经验抽象中受益,通过从其在MATH训练集的痕迹提取抽象存入可检索库,探索推理时检索和强化学习两种使用模式,发现能提高模型在数学和逻辑推理基准上的性能,且框架可转移。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.17641 2026-07-21 cs.AI cs.SE 新提交 70%

Verify, Repair, Repeat, or Stop? Robust Stopping for Noisy Verify-Repair Loops in LLM Agents

验证、修复、重复还是停止?大语言模型代理中用于有噪声验证-修复循环的稳健停止方法

Yitao Wu, Si Shen, Rui Yang, Hong Peng, Bin Hu

专题命中 数学推理 :reasoning(abstract);verifier(abstract);分类 cs.AI

AI总结 研究大语言模型代理中验证-修复循环有噪声时缺乏停止原则的问题,提出VRR-Stop框架,通过四参数噪声模型和信念过滤估计有效性,依真实边际增益符号决策,配对VRR-Guard,提升了停止可靠性与真实有效性。

Comments 18 pages, 10 figures, 10 tables. Under review

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.13899 2026-07-16 cs.AI 新提交 70%

AIMO Interpretability Challenge

AIMO可解释性挑战

Michal Štefánik, Philipp Mondorf, Andreas Waldis, Qianying Liu, Chuan Yang, Michal Spiegel, Josef Kuchař, Marek Kadlčík, Adam Vawda-Oomerjee, Chaoran Liu, Simon Frieder, Barbara Plank, Fazl Barez, Pontus Stenetorp

机构 * National Institute of Informatics(日本国立信息学研究所) Munich Center for Machine Learning / MaiNLP LMU(慕尼黑机器学习中心/慕尼黑大学语言与文学计算研究所) University of Tübingen(图宾根大学) Fuzhou University(福州大学) Masaryk University(马萨里克大学) University College London(伦敦大学学院) University of Oxford(牛津大学)

专题命中 数学推理 :reasoning(abstract);math reasoning(abstract);分类 cs.AI

AI总结 提出AIMO可解释性挑战,基于前沿数学语言模型内部机制区分稳健与虚假推理。利用AIMO问题等资源,提供推理问题、模型访问及鲁棒性评估,助参与者开发识别稳健模型的方法,创建新基准和基线系统,连接可解释性与泛化研究。

Comments Accepted Competition at NeurIPS 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.05346 2026-07-07 cs.AI cs.MA 新提交 70%

OptiAgent: End-to-End Optimization Modeling via Multi-Agent Iterative Refinement

OptiAgent:基于多智能体迭代精化的端到端优化建模

Adriana Laurindo Monteiro, Nayse Fagundes, Gabriel Mattos Langeloh, Gustavo de Oliveira Kanno, Priscila Louise Aguirre, Thiago Costa Rizuti da Rocha, Victor Leme Beltran

机构 * Instituto de Ciência e Tecnologia do Itaú(伊塔乌科技学院)

专题命中 数学推理 :reasoning(abstract);self-correction(abstract);分类 cs.AI

AI总结 针对运筹学问题自然语言描述转可求解数学形式与可执行代码的需求,OptiAgent采用多智能体迭代自校正与多回路验证架构,在多数优化任务基准上取得SOTA性能,建模过程可审计。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.24021 2026-06-30 cs.AI math.AP 70%

QED: An Open-Source Multi-Agent System for Generating Mathematical Proofs on Open Problems

QED:一个用于生成开放问题数学证明的开源多智能体系统

Chenyang An, Qihao Ye, Minghao Pan, Jiayaun Zhang

专题命中 数学推理 :planning(abstract);verifier(abstract);分类 cs.AI

AI总结 提出开源多智能体系统QED,通过分解规划、生成论证和验证正确性的流水线,自动将研究问题转化为完整数学证明,并在18个研究级项目中成功生成5篇原创工作。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.02176 2026-06-30 cs.CL 70%

Adam's Law: Textual Frequency Law on Large Language Models

Adam的定律:大型语言模型中的文本频率定律

Hongyuan Adam Lu, Z. L., Victor Wei, Zefan Zhang, Zhao Hong, Qiqi Xiang, Bowen Cao, Wai Lam

机构 * FaceMind Corporation(FaceMind公司) The Chinese University of Hong Kong(香港中文大学)

专题命中 数学推理 :reasoning(abstract);math reasoning(abstract);分类 cs.CL

AI总结 本文提出文本频率定律,通过优化文本频率提升LLM的提示和微调效果,并通过文本频率蒸馏和课程训练方法验证了其有效性。

Comments ACL 2026 Main Conference; The latest version

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.28166 2026-06-29 cs.AI 新提交 70%

Tandem Reinforcement Learning with Verifiable Rewards

具有可验证奖励的串联强化学习

Difan Jiao, Raghav Singhal, Robert West, Ashton Anderson

机构 * University of Toronto(多伦多大学) EPFL(瑞士联邦理工学院洛桑分校)

专题命中 数学推理 :reasoning(abstract);chain-of-thought(abstract);分类 cs.AI

AI总结 提出串联强化学习(TRL),通过强弱模型交替生成推理链并共同奖励,在保持独立推理能力的同时提升模型间兼容性和可读性。

Comments 21 pages,7 figures,8 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.17735 2026-06-17 cs.AI 新提交 70%

Shattering the Autoregressive Curse: Dynamic Epistemic Entropy Orchestrated Erasable Reinforcement Learning for LLMs

打破自回归诅咒:动态认知熵编排的可擦除强化学习用于大语言模型

Ziliang Wang, Kang An, Faqiang Qian, Jialu Cai, Cijun Ouyang, Yuhang Wang, Qibing Ren, Yichao Wu

机构 * SenseTime(商汤科技) Shanghai Jiao Tong University(上海交通大学)

专题命中 数学推理 :reasoning(abstract);logical reasoning(abstract);分类 cs.AI

AI总结 提出动态认知熵编排的可擦除强化学习(E³RL),通过将模型内生的局部自回归交叉熵作为认知不确定性坐标,利用分段自适应动态阈值和优势分配精准切除逻辑缺陷并重用KV缓存,解决长序列推理中的自回归级联崩溃问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.03417 2026-06-16 cs.CR cs.AI 版本更新 70%

Parallel Test-Time Scaling with Multi-Sequence Verifiers

并行测试时扩展与多序列验证器

Yegon Kim, Seungyoo Lee, Chaeyun Jang, Hyungi Lee, Juho Lee

机构 * Graduate School of AI, KAIST(人工智能研究生院,韩国科学技术院)

专题命中 数学推理 :reasoning(abstract);verifier(abstract);分类 cs.AI

AI总结 提出多序列验证器(MSV),通过条件化候选集预测正确性,改善校准性,提升最佳选择准确率并实现早停策略,在数学推理任务中以不到一半延迟达到相同精度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.16793 2026-06-16 cs.LG 版本更新 70%

Escaping the Cognitive Well: Efficient Competition Math with Off-the-Shelf Models

逃离认知陷阱:使用现成模型高效解决竞赛数学问题

Xingyu Dang, Rohit Agarwal, Rodrigo Porto, Anirudh Goyal, Liam H Fowl, Sanjeev Arora

机构 * Princeton University(普林斯顿大学) Princeton Language and Intelligence(普林斯顿语言与智能)

专题命中 数学推理 :reasoning(abstract);math reasoning(abstract);分类 cs.LG

AI总结 提出一种推理流水线,利用现成模型以极低成本在IMO风格数学问题上达到最佳性能,通过猜想提取和上下文分离解决求解器-评分器流水线中的认知陷阱问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.25450 2026-06-12 cs.AI 版本更新 70%

Cross-Model Disagreement as a Label-Free Correctness Signal

跨模型分歧作为无标签正确性信号

Matt Gorbett, Suman Jana

机构 * Independent Researcher(独立研究者) Department of Computer Science Columbia University(计算机科学系哥伦比亚大学)

专题命中 数学推理 :reasoning(abstract);verifier(abstract);分类 cs.AI

AI总结 提出跨模型分歧作为无标签正确性指标,通过验证模型对生成模型答案的困惑度或熵来检测错误,无需训练或标签,在多个基准上优于模型内不确定性方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.21563 2026-06-12 cs.AI 版本更新 70%

Counterfactual Credit Policy Optimization for Multi-Agent Collaboration

多智能体协作的反事实信用策略优化

Zhongyi Li, Wan Tian, Jinju Chen, Huiming Zhang, Yang Liu, Yikun Ban, Fuzhen Zhuang

机构 * Beihang University(北航) Peking University(北京大学) Beijing University of Posts and Telecommunications(北京邮电大学)

专题命中 数学推理 :reasoning(abstract);verifier(abstract);分类 cs.AI

AI总结 针对多智能体大语言模型协作中信用分配难题,提出CCPO框架,通过反事实信用估计和验证器锚定的自评估两种分配器,将团队奖励转化为个体学习信号,提升数学推理任务表现。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.25158 2026-06-05 cs.AI 70%

Trace2Skill: Distill Trajectory-Local Lessons into Transferable Agent Skills

Trace2Skill: 将轨迹局部经验转化为可迁移的代理技能

Jingwei Ni, Yihao Liu, Xinpeng Liu, Yutao Sun, Mengyu Zhou, Pengyu Cheng, Dexin Wang, Erchao Zhao, Xiaoxi Jiang, Guanjun Jiang

机构 * ETH Zürich University of Zurich(苏黎世联邦理工学院) Peking University(北京大学) Zhejiang University(浙江大学) Qwen Large Model Application Team, Alibaba(阿里巴巴文心一言应用团队)

专题命中 数学推理 :reasoning(abstract);math reasoning(abstract);分类 cs.AI

AI总结 本文提出Trace2Skill框架,通过归纳推理将广泛执行轨迹整合为统一的技能目录,有效提升代理技能的可迁移性和实用性,适用于多种领域。

Comments Work in Progress. May version add more experiments

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.11214 2026-06-04 cs.CL 70%

T$^\star$: Progressive Block Scaling for Masked Diffusion Language Models Through Trajectory Aware Reinforcement Learning

T$^\star$:通过轨迹感知强化学习实现掩码扩散语言模型的渐进块缩放

Hanchen Xia, Baoyou Chen, Yutang Ge, Guojiang Zhao, Siyu Zhu

机构 * Shanghai Academy of AI for Science(上海人工智能科学研究院) Shanghai Innovation Institute(上海创新研究院) Fudan University(复旦大学) School of Mathematical Sciences(数学科学学院) Shanghai Jiao Tong University(上海交通大学) Carnegie Mellon University(卡内基梅隆大学)

专题命中 数学推理 :reasoning(abstract);math reasoning(abstract);分类 cs.CL

AI总结 提出T$^\star$方法,利用基于TraceRL的训练课程,在掩码扩散语言模型中渐进增大块大小,实现高并行解码且性能损失极小。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.05633 2026-06-04 cs.CL 70%

GIFT: Games as Informal Training for Generalizable LLMs

GIFT:游戏作为通用型LLM的非正式训练

Nuoyan Lyu, Bingbing Xu, Xueyun Tian, Weihao Meng, Yige Yuan, Yang Zhang, Zhiyong Huang, Tat-Seng Chua, Huawei Shen

机构 * State Key Laboratory of AI Safety, Institute of Computing Technology, CAS(人工智能安全国家重点实验室,计算技术研究所,中国科学院) University of Chinese Academy of Sciences(中国科学院大学) University of Washington(华盛顿大学) National University of Singapore(新加坡国立大学)

专题命中 数学推理 :reasoning(abstract);planning(abstract);分类 cs.CL

AI总结 提出将游戏作为非正式训练环境,结合协调子任务训练(CST)方法,提升LLM在抽象推理、规划、创造力等通用能力上的泛化性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.03144 2026-06-03 cs.AI 70%

GTBench: A Curriculum-Grounded Benchmark for Evaluating LLMs as Mathematical Research Assistants in Graph Theory

GTBench:一个基于课程体系的基准,用于评估大语言模型作为图论数学研究助手的能力

Noujoud Nader, Ibrahem Aljabea, Patrick Diehl, Deepti Gupta

机构 * Louisiana State University(路易斯安那州立大学) Los Alamos National Laboratory(洛斯阿拉莫斯国家实验室) Texas A&M-Central Texas(德克萨斯大学阿姆斯特朗中央分校)

专题命中 数学推理 :reasoning(abstract);chain-of-thought(abstract);分类 cs.AI

AI总结 本文提出GTBench基准,通过三个难度递增的图论问题组(本科定义、算法推理、研究生证明)评估大语言模型的数学推理能力,发现GPT-5表现最佳,其他模型随难度下降显著,并揭示了人类与自动评估者之间的系统性分歧。

Comments 19 pages, 5 figures, 7 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.01828 2026-06-02 cs.MA cs.AI 70%

Dynamic Trust-Aware Sparse Communication Topology for LLM-Based Multi-Agent Consensus

基于动态信任感知的稀疏通信拓扑用于基于LLM的多智能体共识

Wanshuang Gou, Zihan Liu

机构 * University of Science and Technology of China(中国科学技术大学)

专题命中 数学推理 :reasoning(abstract);logical reasoning(abstract);分类 cs.AI

AI总结 提出DySCo动态稀疏共识机制,通过信任感知的边选择降低通信开销并保持共识质量。

Comments 11 pages, 3 figures, 5 tables

详情

展开后加载摘要…

URL PDF HTML 收藏