arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

大模型推理能力

大模型数学、逻辑、规划、多步推理和测试时计算能力。

2026-03-03 至 2026-03-03 共收录 34 信号源:cs.CL, cs.AI, cs.LG

1. 数学推理 34 篇

2505.18116 2026-03-03 cs.LG cs.CL 90%

NFT: Bridging Supervised Learning and Reinforcement Learning in Math Reasoning

NFT:在数学推理中连接监督学习与强化学习

Huayu Chen, Kaiwen Zheng, Qinsheng Zhang, Ganqu Cui, Lifan Yuan, Yin Cui, Haotian Ye, Tsung-Yi Lin, Ming-Yu Liu, Jun Zhu, Haoxiang Wang

机构 * Tsinghua(清华大学) NVIDIA UIUC(伊利诺伊大学香槟分校) Stanford(斯坦福大学)

专题命中 数学推理 :reasoning(title,abstract);math reasoning(title,abstract);verifier(abstract);分类 cs.CL、cs.LG

AI总结 NFT通过监督学习方法实现LLM自主改进,无需外部教师,在数学推理任务中超越传统RL算法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.01367 2026-03-03 cs.AI cs.CL 88%

Is It Thinking or Cheating? Detecting Implicit Reward Hacking by Measuring Reasoning Effort

这是思考还是作弊?通过测量推理努力来检测隐式奖励黑客

Xinpeng Wang, Nitish Joshi, Barbara Plank, Rico Angell, He He

机构 * LMU Munich(慕尼黑莱茵河大学) New York University(纽约大学) MCML

专题命中 数学推理 :reasoning(title,abstract);chain-of-thought(abstract);CoT(abstract);math reasoning(abstract)

AI总结 TRACE通过测量推理努力检测隐式奖励黑客,通过截断推理链并评估预期奖励来识别模型利用漏洞的行为,提升数学和编码任务的监控效果。

Comments ICLR 2026 Oral Presentation

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.20745 2026-03-03 cs.AI cs.CL cs.LG 87%

AgentMath: Empowering Mathematical Reasoning for Large Language Models via Tool-Augmented Agent

AgentMath: 通过工具增强代理赋能大语言模型的数学推理

Haipeng Luo, Huawen Feng, Qingfeng Sun, Can Xu, Kai Zheng, Yufei Wang, Tao Yang, Han Hu, Yansong Tang

专题命中 数学推理 :reasoning(title,abstract);chain-of-thought(abstract);CoT(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 AgentMath通过整合语言模型和代码解释器,提升大语言模型在复杂数学问题上的推理能力,实现高效训练和高准确率。

Comments This paper has been accepted to ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.19842 2026-03-03 cs.AI cs.LG 86%

DAG-Math: Graph-of-Thought Guided Mathematical Reasoning in LLMs

DAG-Math: 图思维引导的大型语言模型数学推理

Yuanhe Zhang, Ilja Kuzborskij, Jason D. Lee, Chenlei Leng, Fanghui Liu

机构 * Department of Statistics, University of Warwick(沃里克大学统计系) Google DeepMind(谷歌DeepMind) Department of Applied Mathematics, Hong Kong Polytechnic University(香港理工大学应用数学系) School of Mathematical Sciences, Institute of Natural Sciences and MOE-LSC, Shanghai Jiao Tong University(上海交通大学数学科学学院)

专题命中 数学推理 :reasoning(title,abstract);chain-of-thought(abstract);CoT(abstract);分类 cs.AI、cs.LG

AI总结 DAG-Math通过构建图思维引导的数学推理框架,评估LLM的推理能力,揭示了推理忠实度与最终答案准确性的差异。

Comments Accepted by ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.20187 2026-03-03 cs.CL 85%

Diversity-Enhanced Reasoning for Subjective Questions

增强多样性推理以应对主观问题

Yumeng Wang, Zhiyuan Fan, Jiayu Liu, Jen-tse Huang, Yi R. Fung

机构 * Hong Kong University of Science and Technology(香港科技大学) Johns Hopkins University(约翰霍普金斯大学)

专题命中 数学推理 :reasoning(title,abstract);chain-of-thought(abstract);math reasoning(abstract);分类 cs.CL

AI总结 本文提出MultiRole-R1框架,通过引入视角多样性和token级多样性提升主观推理性能,实验显示其在主观任务和高级数学推理中均取得显著提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.00819 2026-03-03 cs.LG cs.AI 84%

Stabilizing Policy Gradients for Sample-Efficient Reinforcement Learning in LLM Reasoning

为LLM推理稳定化策略梯度以实现样本高效的强化学习

Luckeciano C. Melo, Alessandro Abate, Yarin Gal

机构 * OATML, University of Oxford(OATML,牛津大学) OXCAV, University of Oxford(OXCAV,牛津大学)

专题命中 数学推理 :reasoning(title,abstract);math reasoning(abstract);分类 cs.AI、cs.LG

AI总结 CAPO通过曲率感知优化提升LLM推理的样本效率和稳定性

Comments Published at ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.02091 2026-03-03 cs.LG cs.AI cs.CL 82%

Learning from Synthetic Data Improves Multi-hop Reasoning

通过合成数据学习提升多跳推理能力

Anmol Kabra, Yilun Yin, Albert Gong, Kamilė Stankevičiūtė, Dongyoung Go, Johann Lee, Katie Z. Luo, Carla P. Gomes, Kilian Q. Weinberger

机构 * Cornell University(康奈尔大学) University of Cambridge(剑桥大学) Stanford University(斯坦福大学)

专题命中 数学推理 :reasoning(title,abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本研究通过规则生成的合成数据提升LLM多跳推理能力,发现合成数据能有效训练模型组成知识,从而在现实问答任务中表现更优。

Comments Accepted to ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.19807 2026-03-03 cs.CL cs.AI cs.LG 82%

Scaf-GRPO: Scaffolded Group Relative Policy Optimization for Enhancing LLM Reasoning

Scaf-GRPO:基于 scaffolding 的组相对策略优化以增强大语言模型推理能力

Xichen Zhang, Sitong Wu, Yinghao Zhu, Haoru Tan, Shaozuo Yu, Ziyi He, Jiaya Jia

机构 * The Hong Kong University of Science and Technology(香港科技大学) The Chinese University of Hong Kong(香港中文大学) The University of Hong Kong(香港大学)

专题命中 数学推理 :reasoning(title,abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 Scaf-GRPO通过渐进式训练框架,在模型学习停滞时提供分层提示,有效提升大语言模型的数学推理能力。

Comments Code: https://github.com/JIA-Lab-research/Scaf-GRPO Accepted by ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.04474 2026-03-03 cs.AI cs.LG 81%

DRPO: Efficient Reasoning via Decoupled Reward Policy Optimization

DRPO:通过解耦奖励策略优化实现高效推理

Gang Li, Yan Chen, Ming Lin, Tianbao Yang

机构 * Texas A&M University(德克萨斯A&M大学) The University of Virginia(弗吉尼亚大学)

专题命中 数学推理 :reasoning(title,abstract);分类 cs.AI、cs.LG

AI总结 DRPO通过解耦奖励策略优化,有效解决大型推理模型过度思考问题,实现高效推理并减少响应延迟。

Comments Accepted to ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.24298 2026-03-03 cs.LG cs.AI 81%

AReaL: A Large-Scale Asynchronous Reinforcement Learning System for Language Reasoning

AReaL: 一种用于语言推理的大规模异步强化学习系统

Wei Fu, Jiaxuan Gao, Xujie Shen, Chen Zhu, Zhiyu Mei, Chuyi He, Shusheng Xu, Guo Wei, Jun Mei, Jiashu Wang, Tongkai Yang, Binhang Yuan, Yi Wu

机构 * IIIS, Tsinghua University(清华信息学院) Ant Group(蚂蚁集团) HKUST(香港科技大学)

专题命中 数学推理 :reasoning(title,abstract);分类 cs.AI、cs.LG

AI总结 AReaL通过异步机制提升大语言模型推理训练效率,实现GPU利用率显著提升

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.01265 2026-03-03 cs.LG cs.AI cs.CL 80%

RLP: Reinforcement as a Pretraining Objective

RLP:将强化学习作为预训练目标

Ali Hatamizadeh, Syeda Nahida Akter, Shrimai Prabhumoye, Jan Kautz, Mostofa Patwary, Mohammad Shoeybi, Bryan Catanzaro, Yejin Choi

机构 * NVIDIA(英伟达) Carnegie Mellon University(卡内基梅隆大学) Boston University(波士顿大学) Stanford University(斯坦福大学)

专题命中 数学推理 :reasoning(abstract);chain-of-thought(abstract);verifier(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 RLP通过将强化学习的探索精神引入预训练阶段,提升模型在数学和科学任务中的推理能力。

Comments ICLR 2026 camera ready

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.01641 2026-03-03 cs.AI 79%

Learning Structured Reasoning via Tractable Trajectory Control

通过可计算的轨迹控制学习结构化推理

Po-Nien Kung, Zhen Yang, Jeffrey Luo, Cheng-Fu Yang, Haikang Deng, Zi-Yi Dou, Yinfei Yang, Nanyun Peng, Zhe Gan, Kai-Wei Chang

机构 * University of California, Los Angeles(加州大学洛杉矶分校) Apple(苹果公司)

专题命中 数学推理 :reasoning(title,abstract);分类 cs.AI

AI总结 Ctrl-R通过可计算的轨迹控制学习结构化推理,提升复杂问题解决的多样化推理能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.02339 2026-03-03 cs.CL 79%

AStar: Boosting Multimodal Reasoning with Automated Structured Thinking

AStar: 通过自动化结构化思维提升多模态推理

Jinyang Wu, Mingkuan Feng, Guocheng Zhai, Shuai Zhang, Zheng Lian, Fangrui Lv, Pengpeng Shao, Ruihan Jin, Zhengqi Wen, Jianhua Tao

专题命中 数学推理 :reasoning(title,abstract);分类 cs.CL

AI总结 AStar通过自动化结构化思维提升多模态推理效率,实现更高准确率和更强迁移能力。

Comments Accepted by AAAI 2026 Oral

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.02203 2026-03-03 cs.AI cs.CL 73%

Tool Verification for Test-Time Reinforcement Learning

测试时强化学习的工具验证

Ruotong Liao, Nikolai Röhrich, Xiaohan Wang, Yuhui Zhang, Yasaman Samadzadeh, Volker Tresp, Serena Yeung-Levy

机构 * Ludwig-Maximilians-University of Munich(慕尼黑路德维希-马克西米利安大学) Stanford University(斯坦福大学)

专题命中 数学推理 :reasoning(abstract);verifier(abstract);分类 cs.CL、cs.AI

AI总结 T^3RL通过引入测试时工具验证机制,提升测试时强化学习在复杂问题上的表现,减少错误模式崩溃风险。

Comments 12 pages, 11 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.01365 2026-03-03 cs.LG cs.AI cs.RO cs.SY eess.SY 73%

Align and Filter: Improving Performance in Asynchronous On-Policy RL

对齐与过滤:提升异步在线强化学习的性能

Homayoun Honari, Roger Creus Castanyer, Michael Przystupa, Michael Noukhovitch, Pablo Samuel Castro, Glen Berseth

机构 * Mila – Quebec AI Institute, Canada(魁北克AI研究所) University of Alberta, Canada(阿尔伯塔大学)

专题命中 数学推理 :reasoning(abstract);math reasoning(abstract);分类 cs.AI、cs.LG

AI总结 本文提出了一种基于总变分的优势对齐约束策略优化方法,用于缓解异步在线强化学习中的策略滞后问题,并在经典和现代强化学习任务中展示了其优越的鲁棒性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.10609 2026-03-03 cs.CL cs.AI 73%

Online Causal Kalman Filtering for Stable and Effective Policy Optimization

在线因果卡尔曼滤波用于稳定和有效的策略优化

Shuo He, Lang Feng, Xin Cheng, Lei Feng, Bo An

机构 * Nanyang Technological University, Singapore(南洋理工大学,新加坡) Southeast University, China(东南大学,中国)

专题命中 数学推理 :reasoning(abstract);math reasoning(abstract);分类 cs.CL、cs.AI

AI总结 本文提出KPO方法,通过在线因果卡尔曼滤波稳定和提升策略优化效果,有效解决token级重要性采样比率的高方差问题。

Comments Preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.02555 2026-03-03 cs.LG cs.AI 73%

Learning to Explore with Parameter-Space Noise: A Deep Dive into Parameter-Space Noise for Reinforcement Learning with Verifiable Rewards

通过参数空间噪声学习探索:深入研究可验证奖励的强化学习

Bizhe Bai, Xinyue Wang, Peng Ye, Tao Chen

机构 * Shanghai Innovation Institute, Shanghai, China(上海创新研究院) College of Future Information Technology, Fudan University, Shanghai, China(未来信息科技学院,复旦大学) Shanghai AI Laboratory, Shanghai, China(上海人工智能实验室) The Chinese University of Hong Kong, Hong Kong, China(香港中文大学)

专题命中 数学推理 :reasoning(abstract);chain-of-thought(abstract);分类 cs.AI、cs.LG

AI总结 通过参数空间噪声提升探索能力,PSN-GRPO在多个基准中提升推理能力并超越传统探索方法。

Comments 17 pages, 10 Figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.26585 2026-03-03 cs.MA cs.AI 70%

Stop Wasting Your Tokens: Towards Efficient Runtime Multi-Agent Systems

停止浪费你的令牌:迈向高效的运行时多智能体系统

Fulin Lin, Shaowen Chen, Ruishan Fang, Hongwei Wang, Tao Lin

机构 * Zhejiang University(浙江大学) Westlake University(西湖大学) State Key Laboratory of CAD&CG, Zhejiang University(浙江大学计算机辅助设计与图形学国家重点实验室)

专题命中 数学推理 :reasoning(abstract);math reasoning(abstract);分类 cs.AI

AI总结 SupervisorAgent通过运行时自适应监督框架减少多智能体系统中的令牌消耗,提升效率与鲁棒性。

Comments Accepted to ICLR 2026. The code is available at https://github.com/LINs-lab/SupervisorAgent

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.23383 2026-03-03 cs.CL cs.AI cs.LG 67%

Train Once, Answer All: Many Pretraining Experiments for the Cost of One

一次训练,全部回答:为一次训练成本进行多项预训练实验

Sebastian Bordt, Martin Pawelczyk

机构 * University of Tübingen(图宾根大学) Tübingen AI Center(图宾根人工智能中心) University of Vienna(维也纳大学) Faculty of Computer Science(计算机科学学院)

专题命中 数学推理 :reasoning(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 通过一次训练运行同时进行多项预训练实验,有效降低计算成本并提升研究的严谨性。

Comments ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.01822 2026-03-03 cs.CL cs.AI cs.CV cs.LG cs.MA 67%

InnoGym: Benchmarking the Innovation Potential of AI Agents

InnoGym:评估AI智能体创新潜力的基准测试

Jintian Zhang, Kewei Xu, Jingsheng Zheng, Zhuoyun Yu, Yuqi Zhu, Yujie Luo, Lanning Wei, Shuofei Qiao, Lun Du, Da Zheng, Shumin Deng, Huajun Chen, Ningyu Zhang

机构 * Zhejiang University(浙江大学) Ant Group(蚂蚁集团) National University of Singapore(新加坡国立大学) Zhejiang University - Ant Group Joint Laboratory of Knowledge Graph(知识图谱联合实验室)

专题命中 数学推理 :reasoning(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 InnoGym通过引入性能提升和新颖性两个指标,首次系统评估AI智能体的创新潜力,揭示了创造力与有效性的平衡问题。

Comments ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.02245 2026-03-03 cs.LG cs.AI cs.CL 67%

ExGRPO: Learning to Reason from Experience

ExGRPO:从经验中学习推理

Runzhe Zhan, Yafu Li, Zhi Wang, Xiaoye Qu, Dongrui Liu, Jing Shao, Derek F. Wong, Yu Cheng

机构 * University of Macau(澳门大学) Shanghai AI Laboratory(上海人工智能实验室) Nanjing University(南京大学) The Chinese University of Hong Kong(香港中文大学)

专题命中 数学推理 :reasoning(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 ExGRPO通过组织和优先处理有价值的经验,提升大语言模型的推理性能并稳定训练过程。

Comments ICLR 2026 Camera Ready version

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.17616 2026-03-03 cs.LG cs.AI 62%

Stable Asynchrony: Variance-Controlled Off-Policy RL for LLMs

稳定异步性:用于大语言模型的方差控制的非策略强化学习

Luke J. Huang, Zhuoyang Zhang, Qinghao Hu, Shang Yang, Song Han

机构 * MIT(麻省理工学院) NVIDIA(英伟达)

专题命中 数学推理 :reasoning(abstract);分类 cs.AI、cs.LG

AI总结 VCPO通过动态调整学习率和最小方差基线,提升大语言模型异步训练的稳定性与效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.01563 2026-03-03 cs.LG cs.AI 62%

LFPO: Likelihood-Free Policy Optimization for Masked Diffusion Models

LFPO:基于掩码扩散模型的似然自由策略优化

Chenxing Wei, Jiazhen Kang, Hong Wang, Jianqing Zhang, Hao Jiang, Xiaolong Xu, Ningyuan Sun, Ying He, F. Richard Yu, Yao Shu, Bo Jiang

机构 * Shenzhen University(深圳大学) Hong Kong University of Science(香港科学大学) Guangdong Laboratory of Artificial Intelligence(广东省人工智能与数字经济实验室) University of Science(科学技术大学) Shanghai Jiao Tong University(上海交通大学) Carleton University(卡尔顿大学) Southeast University(东南大学)

专题命中 数学推理 :reasoning(abstract);分类 cs.AI、cs.LG

AI总结 LFPO通过似然自由策略优化提升掩码扩散模型的生成质量与推理效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.01335 2026-03-03 cs.LG cs.AI 62%

Provable and Practical In-Context Policy Optimization for Self-Improvement

可证明且实用的上下文内策略优化用于自我改进

Tianrun Yu, Yuxiao Yang, Zhaoyang Wang, Kaixiang Zhao, Porter Jenkins, Xuchao Zhang, Chetan Bansal, Huaxiu Yao, Weitong Zhang

专题命中 数学推理 :reasoning(abstract);分类 cs.AI、cs.LG

AI总结 本文提出ICPO方法,通过上下文内自我反思和最小熵优化,在保持低推理成本的同时实现数学推理任务的高性能

Comments 34 pages, 8 tables, 4 figures, Accepted by ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.01089 2026-03-03 cs.CL cs.LG 62%

CARD: Towards Conditional Design of Multi-agent Topological Structures

CARD: 向多智能体拓扑结构的条件设计迈进

Tongtong Wu, Yanming Li, Ziye Tang, Chen Jiang, Linhao Luo, Guilin Qi, Shirui Pan, Gholamreza Haffari

专题命中 数学推理 :reasoning(abstract);分类 cs.CL、cs.LG

AI总结 CARD通过条件图生成框架实现多智能体通信拓扑的动态适应,提升系统在不同环境下的有效性和鲁棒性。

Comments Accepted to ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.13888 2026-03-03 cs.CL cs.AI 62%

Reliable Fine-Grained Evaluation of Natural Language Math Proofs

自然语言数学证明的可靠细粒度评估

Wenjie Ma, Andrei Cojocaru, Neel Kolhe, Bradley Louie, Robin Said Sharif, Haihan Zhang, Vincent Zhuang, Matei Zaharia, Sewon Min

机构 * UC Berkeley(加州大学伯克利分校) Google DeepMind(谷歌DeepMind) Peking University(北京大学) Allen Institute for AI(人工智能研究院)

专题命中 数学推理 :reasoning(abstract);分类 cs.CL、cs.AI

AI总结 本研究提出ProofGrader,通过结合强推理模型、丰富上下文和简单集成方法,实现对LLM生成数学证明的细粒度评估,有效提升证明生成任务的可靠性。

Comments 40 pages, 7 figures, 15 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.03324 2026-03-03 cs.LG cs.AI 62%

Cache What Lasts: Token Retention for Memory-Bounded KV Cache in LLMs

缓存什么更持久:用于LLMs中内存受限KV缓存的令牌保留

Ngoc Bui, Shubham Sharma, Simran Lamba, Saumitra Mishra, Rex Ying

机构 * Department of Computer Science, Yale University(耶鲁大学计算机科学系) JPMorganChase AI Research(摩根大通人工智能研究)

专题命中 数学推理 :reasoning(abstract);分类 cs.AI、cs.LG

AI总结 TRIM-KV通过学习令牌的内在重要性实现内存受限的KV缓存优化,有效提升LLM在低内存环境下的推理性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.02881 2026-03-03 cs.LG cs.AI 62%

Rewriting Pre-Training Data Boosts LLM Performance in Math and Code

重写预训练数据提升LLM在数学和代码上的表现

Kazuki Fujii, Yukito Tajima, Sakae Mizuki, Masaki Kawamura, Hinari Shimada, Taihei Shiotani, Koshiro Saito, Masanari Oi, Taishi Nakamura, Takumi Okamoto, Shigeki Ishida, Kakeru Hattori, Youmi Ma, Hiroya Takamura, Rio Yokota, Jun Sakuma, Naoaki Okazaki

机构 * Institute of Science Tokyo, Department of Computer Science(东京科学研究所,计算机科学系) National Institute of Advanced Industrial Science and Technology(国家先进工业科学与技术研究院) Institute of Science Tokyo, Institute of Integrated Research, Supercomputing Research Center(东京科学研究所,整合研究所,超级计算研究中心)

专题命中 数学推理 :reasoning(abstract);分类 cs.AI、cs.LG

AI总结 通过重写预训练数据提升LLM在数学和代码任务中的表现

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.20729 2026-03-03 cs.AI physics.comp-ph 57%

Re4: Scientific Computing Agent with Rewriting, Resolution, Review and Revision

Re4: 具有重写、推理、审查和修订的科学计算代理

Ao Cheng, Lei Zhang, Guowei He

专题命中 数学推理 :reasoning(abstract);分类 cs.AI

AI总结 Re4提出一种基于重写、推理、审查和修订机制的科学计算代理,通过协作框架提升代码生成的可靠性与准确性。

Comments 31 pages, 31 figures, Presented at the ICLR 2026 Workshop on AI and Partial Differential Equations (AI&PDE)

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.26144 2026-03-03 cs.AI 57%

The FM Agent

FM代理

Annan Li, Chufan Wu, Zengle Ge, Yee Hin Chong, Zhinan Hou, Lizhe Cao, Cheng Ju, Jianmin Wu, Huaiming Li, Haobo Zhang, Shenghao Feng, Mo Zhao, Fengzhi Qiu, Rui Yang, Mengmeng Zhang, Wenyi Zhu, Yingying Sun, Quan Sun, Shunhao Yan, Danyu Liu, Dawei Yin, Dou Shen

机构 * Baidu AI Cloud(百度AI云)

专题命中 数学推理 :reasoning(abstract);分类 cs.AI

AI总结 FM代理是一种利用LLM推理和进化搜索的通用多代理框架,能够自主解决复杂问题并达到先进水平。

详情

展开后加载摘要…

URL PDF HTML 收藏