arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

大模型推理能力

大模型数学、逻辑、规划、多步推理和测试时计算能力。

共收录 45515 信号源:cs.CL, cs.AI, cs.LG

1. 数学推理 3258 篇

2601.21225 2026-04-29 cs.CL cs.AI 84%

MGSM-Pro: A Simple Strategy for Robust Multilingual Mathematical Reasoning Evaluation

MGSM-Pro:一种用于多语言数学推理评估的简单策略

Tianyi Xu, Kosei Uemura, Alfred Malengo Kondoro, Tadesse Destaw Belay, Catherine Nana Nyaah Essuman, Ifeoma Okoh, Ganiyat Afolabi, Ayodele Awokoya, David Ifeoluwa Adelani

机构 * McGill University(麦吉尔大学) Mila-Quebec AI Institute(蒙特利尔AI研究院) University of Toronto(多伦多大学) Masakhane Hanyang University(翰阳大学) Instituto Politécnico Nacional(国家理工学院) Umbaji University of Ibadan(伊巴德安大学) McPherson University(麦菲逊大学) Canada CIFAR AI Chair(加拿大CIFAR人工智能主席)

专题命中 数学推理 :reasoning(title,abstract);math reasoning(abstract);分类 cs.CL、cs.AI

AI总结 本文提出MGSM-Pro,通过增加数字变化实例提升多语言数学推理评估的鲁棒性,发现低资源语言在不同数字实例下表现下降,且专有模型对数字变化更敏感。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.24003 2026-04-28 cs.CL cs.LG 84%

Stabilizing Efficient Reasoning with Step-Level Advantage Selection

通过步骤级优势选择稳定高效推理

Han Wang, Xiaodong Yu, Jialian Wu, Jiang Liu, Ximeng Sun, Mohit Bansal, Zicheng Liu

机构 * UNC Chapel Hill(北卡罗来纳大学教堂山分校) Advanced Micro Devices, Inc.(先进微器件公司)

专题命中 数学推理 :reasoning(title,abstract);verifier(abstract);分类 cs.CL、cs.LG

AI总结 本文提出SAS方法,在步骤层面选择优势,提升推理稳定性与效率,实验显示在多个基准上准确率提升0.86点,推理长度减少16.3%。

Comments Findings of ACL 2026, Code: https://github.com/HanNight/SAS

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.23213 2026-04-28 cs.CL cs.AI 84%

Scoring, Reasoning, and Selecting the Best! Ensembling Large Language Models via a Peer-Review Process

评分、推理与选择最佳!通过同行评审过程进行大型语言模型的集成

Zhijun Chen, Zeyu Ji, Qianren Mao, Hao Wu, Jinhuan Song, Junhang Cheng, Bangjie Qin, Zhuoran Li, Jingzheng Li, Kai Sun, Zizhe Wang, Yikun Ban, Zhu Sun, Xiangyang Ji, Hailong Sun

机构 * Beihang University, Beijing, China(北京航空航天大学) Zhongguancun Laboratory, Beijing, China(中关村实验室) Beijing University of Posts and Telecommunications(北京邮电大学) Hong Kong University of Science and Technology(香港科学与技术大学) Xi'an Jiaotong University, Xi'an, China(西安交通大学) Tsinghua University, Beijing, China(清华大学) Singapore University of Technology and Design(新加坡科技设计大学)

专题命中 数学推理 :reasoning(title,abstract);math reasoning(abstract);分类 cs.CL、cs.AI

AI总结 本文提出LLM-PeerReview方法,通过同行评审机制集成多个大型语言模型,提升响应质量。实验显示其在多个数据集上优于Smoothie-Global,适用于事实性问答、数学推理等任务。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.26771 2026-04-21 cs.CL cs.LG 84%

LogicDiff: Logic-Guided Denoising Improves Zero-Shot Reasoning in Masked Diffusion Language Models

LogicDiff:逻辑引导去噪提升掩码扩散语言模型的零样本推理

Shaik Aman

机构 * Independent Researcher(独立研究者)

专题命中 数学推理 :reasoning(title,abstract);chain-of-thought(abstract);分类 cs.CL、cs.LG

AI总结 LogicDiff通过逻辑角色引导去噪策略提升掩码扩散语言模型的零样本推理能力,显著提高GSM8K和MATH-500任务的准确率,但较少样本提示下效果受限。

Comments 9 pages, 3 figures, 3 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.11274 2026-04-20 cs.AI cs.CL 84%

SelfBudgeter: Adaptive Token Allocation for Efficient LLM Reasoning

SelfBudgeter:面向高效大语言模型推理的自适应令牌分配

Zheng Li, Qingxiu Dong, Jingyuan Ma, Di Zhang, Kai Jia, Zhifang Sui

机构 * State Key Laboratory for Multimedia Information Processing, School of Computer Science, Peking University(多媒体信息处理国家重点实验室,计算机学院,北京大学) BandAI, Bytedance(字节跳动BandAI)

专题命中 数学推理 :reasoning(title,abstract);math reasoning(abstract);分类 cs.CL、cs.AI

AI总结 本文提出SelfBudgeter策略,通过自适应预算分配提升LLM推理效率,实验显示在数学推理任务中平均响应长度压缩61%并保持准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.03111 2026-04-03 cs.LG cs.CL 84%

One Sample to Rule Them All: Extreme Data Efficiency in Multidiscipline Reasoning with Reinforcement Learning

一个样本统治一切:通过强化学习实现多学科推理的极端数据效率

Yiyuan Li, Zhen Huang, Yanan Wu, Weixun Wang, Xuefeng Li, Yijia Luo, Wenbo Su, Bo Zheng, Pengfei Liu

机构 * Taobao & Tmall Group of Alibaba(阿里巴巴淘宝天猫集团) GAIR

专题命中 数学推理 :reasoning(title,abstract);math reasoning(abstract);分类 cs.CL、cs.LG

AI总结 本文提出多学科学习框架,通过一个训练样本提升多领域推理能力,证明样本质量而非数量对模型性能的关键作用。

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.13266 2026-04-01 cs.CL cs.AI 84%

QuestA: Expanding Reasoning Capacity in LLMs via Question Augmentation

QuestA: 通过问题增强扩展大语言模型的推理能力

Jiazheng Li, Hongzhou Lin, Hong Lu, Kaiyue Wen, Zaiwen Yang, Jiaxuan Gao, Yi Wu, Jingzhao Zhang

机构 * Tsinghua University(清华大学) Shanghai Qi Zhi Institute(上海期智研究院) Amazon(亚马逊) Stanford University(斯坦福大学)

专题命中 数学推理 :reasoning(title,abstract);math reasoning(abstract);分类 cs.CL、cs.AI

AI总结 QuestA通过问题增强策略在训练中引入部分解以降低问题难度,提升大语言模型在数学推理任务中的推理能力,取得新的SOTA结果。

Comments 25 pages, 18 figures, ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.16950 2026-03-26 cs.LG cs.AI cs.IT math.IT 84%

Bottlenecked Transformers: Periodic KV Cache Consolidation for Generalised Reasoning

瓶颈化Transformer:用于通用推理的周期性KV缓存整合

Adnan Oomerjee, Zafeirios Fountas, Haitham Bou-Ammar, Jun Wang

机构 * University College London(伦敦大学学院) Huawei Noah’s Ark(华为诺亚方舟)

专题命中 数学推理 :reasoning(title,abstract);math reasoning(abstract);分类 cs.AI、cs.LG

AI总结 本文提出瓶颈化Transformer,通过周期性非因果的KV重写提升推理能力,基于信息瓶颈理论分析其有效性,并在数学推理任务中验证性能提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.01037 2026-03-24 cs.LG cs.AI 84%

CurES: From Gradient Analysis to Efficient Curriculum Learning for Reasoning LLMs

CurES:从梯度分析到高效课程学习以提升推理大语言模型

Yongcheng Zeng, Zexu Sun, Bokai Ji, Erxue Min, Hengyi Cai, Shuaiqiang Wang, Dawei Yin, Haifeng Zhang, Xu Chen, Jun Wang

机构 * Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所) School of Artificial Intelligence, University of Chinese Academy of Sciences(中国科学院大学人工智能学院) Baidu Inc.(百度公司) University College London(伦敦大学学院)

专题命中 数学推理 :reasoning(title,abstract);math reasoning(abstract);分类 cs.AI、cs.LG

AI总结 本文提出CurES方法,通过梯度优化理论分析,改进大语言模型推理任务的训练效率,实验显示其在多个数学推理基准上优于现有方法。

Comments 25 pages, 10 Figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.18886 2026-03-20 cs.AI cs.CL 84%

Reasoning over mathematical objects: on-policy reward modeling and test time aggregation

数学对象推理:在线奖励建模与测试时间聚合

Pranjal Aggarwal, Marjan Ghazvininejad, Seungone Kim, Ilia Kulikov, Jack Lanchantin, Xian Li, Tianjian Li, Bo Liu, Graham Neubig, Anaelia Ovalle, Swarnadeep Saha, Sainbayar Sukhbaatar, Sean Welleck, Jason Weston, Chenxi Whitehouse, Adina Williams, Jing Xu, Ping Yu, Weizhe Yuan, Jingyu Zhang, Wenting Zhao

机构 * FAIR at Meta(Meta旗下的FAIR)

专题命中 数学推理 :reasoning(title,abstract);test-time compute(abstract);分类 cs.CL、cs.AI

AI总结 本文提出改进数学对象推理的三个贡献:构建数学对象推导的训练数据和基准Principia套件,提供强LLM判官和验证器的训练方案,展示在线训练可提升测试时计算能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.16206 2026-03-18 cs.LG cs.CL 84%

Offline Exploration-Aware Fine-Tuning for Long-Chain Mathematical Reasoning

离线探索感知微调用于长链数学推理

Yongyu Mu, Jiali Zeng, Fandong Meng, JingBo Zhu, Tong Xiao

机构 * NLP Lab, School of Computer Science and Engineering, Northeastern University, Shenyang, China(东北大学计算机科学与工程学院自然语言处理实验室,中国沈阳) Pattern Recognition Center, WeChat AI, Tencent Inc, China(腾讯公司微信人工智能部门模式识别中心,中国)

专题命中 数学推理 :reasoning(title,abstract);chain-of-thought(abstract);分类 cs.CL、cs.LG

AI总结 本文提出OXA微调方法,通过优化两个目标提升数学推理能力,实验显示在六个基准测试中OXA相比传统SFT在Pass@1和Pass@$k$上平均提升6和5分。

Comments Working in process

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.09184 2026-03-11 cs.LG cs.AI 84%

Latent-DARM: Bridging Discrete Diffusion And Autoregressive Models For Reasoning

Latent-DARM: 联结离散扩散与自回归模型以实现推理

Lina Berrayana, Ahmed Heakl, Abdullah Sohail, Thomas Hofmann, Salman Khan, Wei Chen

机构 * EPFL(苏黎世联邦理工学院) MBZUAI(马克斯·普朗克人工智能研究所) ETH Zürich(苏黎世联邦理工学院) Microsoft Research Asia(微软亚洲研究院)

专题命中 数学推理 :reasoning(title,abstract);planning(abstract);分类 cs.AI、cs.LG

AI总结 Latent-DARM通过结合离散扩散模型与自回归模型,提升多智能体系统在推理任务中的表现和协作效率。

Comments Published at LIT Workshop at ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.00819 2026-03-03 cs.LG cs.AI 84%

Stabilizing Policy Gradients for Sample-Efficient Reinforcement Learning in LLM Reasoning

为LLM推理稳定化策略梯度以实现样本高效的强化学习

Luckeciano C. Melo, Alessandro Abate, Yarin Gal

机构 * OATML, University of Oxford(OATML,牛津大学) OXCAV, University of Oxford(OXCAV,牛津大学)

专题命中 数学推理 :reasoning(title,abstract);math reasoning(abstract);分类 cs.AI、cs.LG

AI总结 CAPO通过曲率感知优化提升LLM推理的样本效率和稳定性

Comments Published at ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.05850 2026-02-24 cs.CL cs.AI 84%

Cross-lingual Collapse: How Language-Centric Foundation Models Shape Reasoning in Large Language Models

跨语言崩溃:语言中心化基础模型如何塑造大语言模型的推理

Cheonbok Park, Jeonghoon Kim, Joosung Lee, Sanghwan Bae, Jaegul Choo, Kang Min Yoo

机构 * NAVER Cloud(NAVER云) KAIST(韩国科学技术院)

专题命中 数学推理 :reasoning(title,abstract);CoT(abstract);分类 cs.CL、cs.AI

AI总结 该研究探讨了多语言模型在长链思考中因语言中心化先验导致的推理能力下降问题,并提出通过语言一致性奖励等方法缓解这一现象。

Comments Preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.14451 2026-02-17 cs.AI cs.CL 84%

Precedent-Informed Reasoning: Mitigating Overthinking in Large Reasoning Models via Test-Time Precedent Learning

基于先例的推理:通过测试时先例学习缓解大推理模型中的过度思考

Qianyue Wang, Jinwu Hu, Huanxiang Lin, Bolin Chen, Zhiquan Wen, Yaofo Chen, Yu Rong, Mingkui Tan

机构 * South China University of Technology(华南理工大学) Pazhou Laboratory(黄埔实验室) DAMO Academy(达摩院)

专题命中 数学推理 :reasoning(title,abstract);chain-of-thought(abstract);分类 cs.CL、cs.AI

AI总结 PIR通过测试时先例学习,优化大推理模型的推理过程,减少冗余探索并提升准确率与效率的平衡。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.13761 2026-02-11 cs.AI cs.CL 84%

THOR: Tool-Integrated Hierarchical Optimization via RL for Mathematical Reasoning

THOR:通过强化学习进行工具集成的分层优化以实现数学推理

Qikai Chang, Zhenrong Zhang, Pengfei Hu, Jun Du, Jiefeng Ma, Yicheng Pan, Jianshu Zhang, Quan Liu, Jianqing Gao

机构 * University of Science and Technology of China(中国科学技术大学) iFLYTEK Research(iFLYTEK研究院)

专题命中 数学推理 :reasoning(title,abstract);self-correction(abstract);分类 cs.CL、cs.AI

AI总结 THOR通过强化学习实现工具集成的分层优化,提升数学推理和代码生成能力。

Comments 22 pages, 13 figures, ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.03950 2026-02-10 cs.AI cs.LG cs.MA 84%

Enhancing Mathematical Problem Solving in LLMs through Execution-Driven Reasoning Augmentation

通过执行驱动推理增强提升大语言模型的数学问题解决能力

Aditya Basarkar, Benyamin Tabarsi, Tiffany Barnes, Dongkuan Xu

机构 * North Carolina State University(北卡罗来纳州立大学)

专题命中 数学推理 :reasoning(title,abstract);chain-of-thought(abstract);分类 cs.AI、cs.LG

AI总结 本研究提出IIPC方法,通过迭代优化程序推理链并结合执行反馈,提升大语言模型的数学问题解决能力。

Comments 9 pages, 7 figures, submitted to ACL ARR 2026, hyperlink to code repository provided in the abstract

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.03380 2026-01-27 cs.CL cs.AI 84%

Online Difficulty Filtering for Reasoning Oriented Reinforcement Learning

面向推理导向强化学习的在线难度过滤

Sanghwan Bae, Jiwoo Hong, Min Young Lee, Hanbyul Kim, JeongYeon Nam, Donghyun Kwak

机构 * NAVER Cloud(NAVER云) KAIST AI(韩国科学技术院人工智能研究所) TwelveLabs

专题命中 数学推理 :reasoning(title,abstract);math reasoning(abstract);分类 cs.CL、cs.AI

AI总结 本研究提出一种面向推理导向强化学习的在线难度过滤方法,通过理论分析和实验验证,证明平衡过滤能提升学习效率和样本效率。

Comments To appear in EACL 2026 (main conference)

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.06677 2026-01-13 cs.LG cs.AI 84%

Plasticity vs. Rigidity: The Impact of Low-Rank Adapters on Reasoning on a Micro-Budget

可塑性与刚性:低秩适配器对微预算推理的影响

Zohaib Khan, Omer Tafveez, Zoha Hayat Bhatti

机构 * University of Michigan(密歇根大学)

专题命中 数学推理 :reasoning(title,abstract);chain-of-thought(abstract);分类 cs.AI、cs.LG

AI总结 研究通过低秩适配器在微预算下提升小型模型推理能力,发现高秩适配器能显著增强模型可塑性,但数学对齐模型性能下降,揭示了预算限制对模型优化的复杂影响。

Comments 9 pages, 4 figures, 2 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.19361 2026-01-09 cs.CL cs.AI 84%

AgenticMath: Enhancing LLM Reasoning via Agentic-based Math Data Generation

AgenticMath: 通过基于代理的数学数据生成增强LLM推理

Xianyang Liu, Yilin Liu, Shuai Wang, Hao Cheng, Andrew Estornell, Yuzhi Zhao, Jun Shu, Jiaheng Wei

机构 * King’s College London(伦敦国王学院) Hong Kong Baptist University(香港 Baptist 大学) The Hong Kong University of Science and Technology (Guangzhou)(香港科学与技术大学(广州)) ByteDance Seed(字节跳动种子) City University of Hong Kong(香港城市大学) Xi’an Jiaotong University(西安交通大学)

专题命中 数学推理 :reasoning(title,abstract);chain-of-thought(abstract);分类 cs.CL、cs.AI

AI总结 AgenticMath通过基于代理的数学数据生成方法,提升LLM在数学推理任务上的性能。

Comments 8 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.10019 2025-12-16 cs.CL cs.AI 84%

Decoupling Understanding from Reasoning via Problem Space Mapping for Small-Scale Model Reasoning

通过问题空间映射解耦理解与推理以提升小型模型推理能力

Li Wang, Changhao Zhang, Zengqi Xiu, Kai Lu, Xin Yu, Kui Zhang, Wenjun Wu

专题命中 数学推理 :reasoning(title,abstract);logical reasoning(abstract);分类 cs.CL、cs.AI

AI总结 DURIT通过问题空间映射解耦理解和推理,提升小型模型在数学和逻辑推理任务中的性能和鲁棒性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.03176 2025-12-04 cs.LG cs.AI 84%

Plantain: Plan-Answer Interleaved Reasoning

Plantain: 计划-答案交错推理

Anthony Liang, Jonathan Berant, Adam Fisch, Abhimanyu Goyal, Kalpesh Krishna, Jacob Eisenstein

机构 * Google DeepMind(谷歌DeepMind) University of Southern California(南加州大学)

专题命中 数学推理 :reasoning(title,abstract);math reasoning(abstract);分类 cs.AI、cs.LG

AI总结 Plantain通过计划-思考-回答的交错推理方式,提升数学推理和编码任务的性能,同时减少响应时间。

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.01657 2025-11-19 cs.LG cs.AI 84%

Improving Rule-based Reasoning in LLMs using Neurosymbolic Representations

Varun Dhanraj, Chris Eliasmith

机构 * School of Computer Science, University of Waterloo, Waterloo, Canada(计算机科学学院,滑铁卢大学,滑铁卢,加拿大) Centre for Theoretical Neuroscience, University of Waterloo(理论神经科学中心,滑铁卢大学)

专题命中 数学推理 :reasoning(title,abstract);chain-of-thought(abstract);分类 cs.AI、cs.LG

Journal ref Proceedings of the 2025 Conference on Empirical Methods in Natural Language Processing (EMNLP), pages 30577--30596

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.22638 2025-11-06 cs.LG cs.AI 84%

Layer Importance for Mathematical Reasoning is Forged in Pre-Training and Invariant after Post-Training

Aadim Nepal, Safal Shrestha, Anubhav Shrestha, Minwu Kim, Jalal Naghiyev, Ravid Shwartz-Ziv, Keith Ross

机构 * New York University Abu Dhabi(纽约大学阿布扎赫尔分校) Technical University of Munich(慕尼黑技术大学) NYU Center for Data Science(纽约大学数据科学中心)

专题命中 数学推理 :reasoning(title,abstract);math reasoning(abstract);分类 cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.24256 2025-11-03 cs.CL cs.LG 84%

From Memorization to Reasoning in the Spectrum of Loss Curvature

Jack Merullo, Srihita Vatsavaya, Lucius Bushnaq, Owen Lewis

专题命中 数学推理 :reasoning(title,abstract);logical reasoning(abstract);分类 cs.CL、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.23629 2025-10-29 cs.LG cs.AI cs.PL 84%

Chain of Execution Supervision Promotes General Reasoning in Large Language Models

Nuo Chen, Zehua Li, Keqin Bao, Junyang Lin, Dayiheng Liu

机构 * Qwen Team, Alibaba(阿里巴巴通义实验室) Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州)) University of Science and Technology of China(中国科学技术大学)

专题命中 数学推理 :reasoning(title,abstract);chain-of-thought(abstract);分类 cs.AI、cs.LG

Journal ref 39th Conference on Neural Information Processing Systems (NeurIPS 2025)

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.20272 2025-10-24 cs.LG cs.AI 84%

Limits of PRM-Guided Tree Search for Mathematical Reasoning with LLMs

Tristan Cinquin, Geoff Pleiss, Agustinus Kristiadi

机构 * University of Tübingen(图宾根大学) University of British Columbia(不列颠哥伦比亚大学) Vector Institute(向量研究所) Western University(西部大学)

专题命中 数学推理 :reasoning(title,abstract);chain-of-thought(abstract);分类 cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.23703 2025-10-14 cs.AI cs.CL 84%

Let's Reason Formally: Natural-Formal Hybrid Reasoning Enhances LLM's Math Capability

Ruida Wang, Yuxin Li, Yi R. Fung, Tong Zhang

机构 * University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) Hong Kong University of Science and Technology(香港科学与技术大学)

专题命中 数学推理 :reasoning(title,abstract);math reasoning(abstract);分类 cs.CL、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.01928 2025-10-07 cs.LG cs.AI 84%

MALT: Improving Reasoning with Multi-Agent LLM Training

Sumeet Ramesh Motwani, Chandler Smith, Rocktim Jyoti Das, Rafael Rafailov, Ivan Laptev, Philip H. S. Torr, Fabio Pizzati, Ronald Clark, Christian Schroeder de Witt

机构 * University of Oxford(牛津大学) Cooperative AI Foundation(合作人工智能基金会) MBZUAI(穆扎夫卡尔人工智能研究所) Stanford University(斯坦福大学)

专题命中 数学推理 :reasoning(title,abstract);chain-of-thought(abstract);分类 cs.AI、cs.LG

Comments Published at COLM 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.21998 2025-10-03 cs.AI cs.LG 84%

GSM-Agent: Understanding Agentic Reasoning Using Controllable Environments

Hanlin Zhu, Tianyu Guo, Song Mei, Stuart Russell, Nikhil Ghosh, Alberto Bietti, Jiantao Jiao

机构 * UC Berkeley(加州大学伯克利分校) Flatiron Institute(Flatiron研究所) Nvidia(英伟达)

专题命中 数学推理 :reasoning(title,abstract);math reasoning(abstract);分类 cs.AI、cs.LG

Comments 39 pages, 8 figures

详情

展开后加载摘要…

URL PDF HTML 收藏