arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型推理能力

大模型数学、逻辑、规划、多步推理和测试时计算能力。

2026-02-17 至 2026-02-17 共收录 166 信号源:cs.CL, cs.AI, cs.LG

1. 数学推理 12 篇

2602.14444 2026-02-17 cs.LG cs.AI 86%

Broken Chains: The Cost of Incomplete Reasoning in LLMs

断裂的链条:在大语言模型中不完整推理的成本

Ian Su, Gaurav Purushothaman, Jey Narayan, Ruhika Goel, Kevin Zhu, Sunishchal Dev, Yash More, Maheep Chaudhary

专题命中 数学推理 :reasoning(title,abstract);chain-of-thought(abstract);CoT(abstract);分类 cs.AI、cs.LG

AI总结 研究探讨了大语言模型在不同推理模式下在标记限制下的表现,发现截断推理可能有害,代码退化较好,混合推理表现欠佳,鲁棒性取决于模型。

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.07861 2026-02-17 cs.CL cs.AI cs.LG 85%

Scalable LLM Reasoning Acceleration with Low-rank Distillation

可扩展的大语言模型推理加速与低秩蒸馏

Harry Dong, Bilge Acun, Beidi Chen, Yuejie Chi

机构 * CMU Department of Electrical and Computer Engineering(卡内基梅隆大学电气与计算机工程系) Carnegie Mellon University(卡内基梅隆大学) Meta FAIR at Meta(Meta FAIR) CMU(卡内基梅隆大学)

专题命中 数学推理 :reasoning(title,abstract);math reasoning(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 Caprese通过低秩蒸馏方法恢复高效推理方法中丢失的数学推理能力,同时减少参数数量和延迟,提升响应效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.14451 2026-02-17 cs.AI cs.CL 84%

Precedent-Informed Reasoning: Mitigating Overthinking in Large Reasoning Models via Test-Time Precedent Learning

基于先例的推理:通过测试时先例学习缓解大推理模型中的过度思考

Qianyue Wang, Jinwu Hu, Huanxiang Lin, Bolin Chen, Zhiquan Wen, Yaofo Chen, Yu Rong, Mingkui Tan

机构 * South China University of Technology(华南理工大学) Pazhou Laboratory(黄埔实验室) DAMO Academy(达摩院)

专题命中 数学推理 :reasoning(title,abstract);chain-of-thought(abstract);分类 cs.CL、cs.AI

AI总结 PIR通过测试时先例学习,优化大推理模型的推理过程,减少冗余探索并提升准确率与效率的平衡。

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.08838 2026-02-17 cs.LG cs.AI stat.ML 81%

wd1: Weighted Policy Optimization for Reasoning in Diffusion Language Models

wd1: 为扩散语言模型推理的加权策略优化

Xiaohang Tang, Rares Dolga, Sangwoong Yoon, Ilija Bogunovic

机构 * Department of Statistical Science, University College London, United Kingdom(伦敦大学统计科学系) UCL AI Centre, University College London, United Kingdom(伦敦大学UCL人工智能中心) Graduate School of AI, Ulsan National Institute of Science and Technology, South Korea(韩国乌山国立科学与技术研究院人工智能研究生院) Department of Mathematics and Computer Science, Universität Basel, Switzerland(巴塞尔大学数学与计算机科学系)

专题命中 数学推理 :reasoning(title,abstract);分类 cs.AI、cs.LG

AI总结 wd1通过加权策略优化提升扩散语言模型推理能力,实现更高准确率和更低计算成本。

Comments Accepted to ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.20426 2026-02-17 cs.AI 79%

RV-Syn: Rational and Verifiable Mathematical Reasoning Data Synthesis based on Structured Function Library

RV-Syn: 基于结构化函数库的理性且可验证的数学推理数据合成

Jiapeng Wang, Jinhao Jiang, Zhiqiang Zhang, Jun Zhou, Wayne Xin Zhao

机构 * Gaoling School of Artificial Intelligence, Renmin University of China(中国人民大学人工智能学院) Ant Group(蚂蚁集团) Beijing Key Laboratory of Research on Large Models and Intelligent Governance(北京大型模型与智能治理重点实验室)

专题命中 数学推理 :reasoning(title,abstract);分类 cs.AI

AI总结 RV-Syn通过结构化函数库生成可验证的数学推理数据,提升数据质量和生成效率。

Comments Accepted to EACL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.18702 2026-02-17 cs.LG cs.AI cs.AR 76%

From Fuzzy to Exact: The Halo Architecture for Infinite-Depth Reasoning via Rational Arithmetic

从模糊到精确:通过有理算术的Halo架构实现无限深度推理

Hansheng Ren

机构 * Hansheng Ren(独立研究者)

专题命中 数学推理 :reasoning(title);分类 cs.AI、cs.LG

AI总结 Halo架构通过有理算术实现无限深度推理,结合双环拓扑和精确推断单元,提升模型稳定性和效率,实现从模糊到精确的数学框架转型。

Comments Architecture update: Formalizes the Dual-Ring Topology and the Clean Transformer

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.13262 2026-02-17 cs.AI cs.CL 73%

General learned delegation by clones

通过克隆实现通用学习委托

Darren Li, Meiqi Chen, Chenze Shao, Fandong Meng, Jie Zhou

机构 * Qiuzhen College, Tsinghua University(清华大学齐振学院) Pattern Recognition Center, WeChat AI, Tencent Inc(微信AI模式识别中心,腾讯公司)

专题命中 数学推理 :reasoning(abstract);math reasoning(abstract);分类 cs.CL、cs.AI

AI总结 SELFCEST通过代理强化学习实现通用学习委托,利用克隆技术在不同并行上下文中分配资源,提升数学推理和长上下文问答任务的准确性与效率。

Comments Code available at https://github.com/SuffixAutomata/SELFCEST

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.16652 2026-02-17 cs.LG cs.AI 62%

Evolution Strategies at the Hyperscale

超大规模进化策略

Bidipta Sarkar, Mattie Fellows, Juan Agustin Duque, Alistair Letcher, Antonio León Villares, Anya Sims, Clarisse Wibault, Dmitry Samsonov, Dylan Cope, Jarek Liesen, Kang Li, Lukas Seier, Theo Wolf, Uljad Berdica, Valentin Mohl, Alexander David Goldie, Aaron Courville, Karin Sevegnani, Shimon Whiteson, Jakob Nicolaus Foerster

专题命中 数学推理 :reasoning(abstract);分类 cs.AI、cs.LG

AI总结 EGGROLL通过低秩学习提升算术强度,实现大规模参数模型的高效训练,稳定预训练非线性循环语言模型并提升推理任务性能。

Comments 76 pages, 15 figures, Website at https://eshyperscale.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.03195 2026-02-17 cs.LG cs.AI 62%

Reinforcement Learning with Promising Tokens for Large Language Models

基于有前景标记的强化学习用于大语言模型

Jing-Cheng Pang, Liang Lu, Xian Tang, Kun Jiang, Sijie Wu, Kai Zhang, Xubin Li

机构 * huawei(华为技术有限公司)

专题命中 数学推理 :reasoning(abstract);分类 cs.AI、cs.LG

AI总结 基于有前景标记的强化学习框架通过解耦战略决策与标记生成,有效提升大语言模型的训练稳定性与样本效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.14468 2026-02-17 cs.LG 57%

LACONIC: Length-Aware Constrained Reinforcement Learning for LLM

LACONIC:面向LLM的长度感知约束强化学习

Chang Liu, Yiran Zhao, Lawrence Liu, Yaoqi Ye, Csaba Szepesvári, Lin F. Yang

机构 * University of California, Los Angeles(加州大学洛杉矶分校) Salesforce AI Research(Salesforce AI研究院) National University of Singapore(新加坡国立大学) University of Alberta(阿尔伯塔大学)

专题命中 数学推理 :reasoning(abstract);分类 cs.LG

AI总结 LACONIC通过长度感知约束强化学习,在保持任务性能的同时有效控制输出长度,减少50%以上。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.13103 2026-02-17 cs.LG 57%

R-Diverse: Mitigating Diversity Illusion in Self-Play LLM Training

R-Diverse: 缓解自博弈LLM训练中的多样性幻觉

Gengsheng Li, Jinghan He, Shijie Wang, Dan Zhang, Ruiqi Liu, Renrui Zhang, Zijun Yao, Junfeng Fang, Haiyun Guo, Jinqiao Wang

机构 * Foundation Model Research Center, Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所基础模型研究中心) School of Artificial Intelligence, University of Chinese Academy of Sciences(中国科学院大学人工智能学院) Wuhan AI Research(武汉人工智能研究所) National University of Singapore(新加坡国立大学) Tsinghua University(清华大学)

专题命中 数学推理 :reasoning(abstract);分类 cs.LG

AI总结 R-Diverse通过引入记忆增强惩罚和技能感知测量,缓解自博弈LLM训练中的多样性幻觉问题,提升模型推理能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.07132 2026-02-17 stat.ML cs.LG 57%

Discrete Adjoint Matching

离散共轭匹配

Oswin So, Brian Karrer, Chuchu Fan, Ricky T. Q. Chen, Guan-Horng Liu

机构 * Massachusetts Institute of Technology(麻省理工学院) FAIR at Meta(Meta 的 FAIR)

专题命中 数学推理 :reasoning(abstract);分类 cs.LG

AI总结 本文提出离散共轭匹配方法,用于微调离散生成模型,通过离散域上的共轭估计器解决熵正则化奖励优化问题。

Comments ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 代码与定理证明 6 篇

2602.13962 2026-02-17 cs.SE 82%

CodeGlance: Understanding Code Reasoning Challenges in LLMs through Multi-Dimensional Feature Analysis

CodeGlance:通过多维特征分析理解LLM中的代码推理挑战

Yunkun Wang, Xuanhe Zhang, Junxiao Han, Chen Zhi, Shuiguang Deng

专题命中 代码与定理证明 :reasoning(title,abstract);CoT(abstract)

AI总结 CodeGlance通过多维特征分析揭示LLM在代码推理中的挑战,发现未见过的函数推理对小型模型尤为困难,提出改进策略并提供开发指导。

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.07443 2026-02-17 cs.AI cs.GT 79%

Approximating Human Strategic Reasoning with LLM-Enhanced Recursive Reasoners Leveraging Multi-agent Hypergames

用LLM增强的递归推理器近似人类战略推理

Vince Trencsenyi, Agnieszka Mensfelt, Kostas Stathis

机构 * Royal Holloway University of London(伦敦皇家霍洛威大学)

专题命中 代码与定理证明 :reasoning(title,abstract);分类 cs.AI

AI总结 本文提出了一种基于LLM增强的递归推理器框架,通过多智能体超游戏模型评估LLM的递归推理能力,并展示了其在近似人类行为和最优解达成方面的优势。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.13574 2026-02-17 cs.SE cs.CR 78%

Execution-State-Aware LLM Reasoning for Automated Proof-of-Vulnerability Generation

面向执行状态的LLM推理用于自动化漏洞证明生成

Haoyu Li, Xijia Che, Yanhao Wang, Xiaojing Liao, Luyi Xing

专题命中 代码与定理证明 :reasoning(title,abstract)

AI总结 DrillAgent通过结合LLM语义推理与执行状态反馈,实现自动化漏洞证明生成,显著提升漏洞检测效率。

Comments Version 1.0 (13 pages, 7 figures)

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.13587 2026-02-17 cs.AI cs.MA 57%

A First Proof Sprint

首次证明冲刺

Joseph Corneli

机构 * Hyperreal Enterprises Ltd(超现实企业有限公司)

专题命中 代码与定理证明 :verifier(abstract);分类 cs.AI

AI总结 本文通过多智能体证明冲刺方法,解决十个研究级问题,采用结构意识验证和层切换策略提高证明可靠性与校准。

Comments 144 pages, 7 color images. Submission to First Proof February 2026 (arxiv:2602.05192, https://1stproof.org/), uploaded 20:07 Friday, 13 February 2026 Pacific Time (PT)

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.15756 2026-02-17 cs.SE cs.AI 57%

Automated Proof Generation for Rust Code via Self-Evolution

通过自我进化实现Rust代码的自动证明生成

Tianyu Chen, Shuai Lu, Shan Lu, Yeyun Gong, Chenyuan Yang, Xuheng Li, Md Rakib Hossain Misu, Hao Yu, Nan Duan, Peng Cheng, Fan Yang, Shuvendu K Lahiri, Tao Xie, Lidong Zhou

机构 * Peking University(北京大学) Microsoft Research(微软研究院) University of Illinois at Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) Columbia University(哥伦比亚大学) University of California Irvine(加州大学 Irvine 分校)

专题命中 代码与定理证明 :verifier(abstract);分类 cs.AI

AI总结 SAFE框架通过自我进化循环和自我调试机制,提升开源模型自动编写Rust代码证明的能力,准确率达52.52%

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.13212 2026-02-17 cs.RO cs.MA cs.SY eess.SY 50%

UAVGENT: A Language-Guided Distributed Control Framework

UAVGENT: 一种语言引导的分布式控制框架

Ziyi Zhang, Xiyu Deng, Guannan Qu, Yorie Nakahira

机构 * Department of Electrical and Computer Engineering(电气与计算机工程系) Carnegie Mellon University(卡内基梅隆大学)

专题命中 代码与定理证明 :reasoning(abstract)

AI总结 UAVGENT通过结合语言引导的任务推理与分布式反馈控制,实现了多无人机系统在复杂任务中的鲁棒性和稳定性。

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 逻辑推理 7 篇

2602.13738 2026-02-17 cs.AI 87%

OneLatent: Single-Token Compression for Visual Latent Reasoning

OneLatent:视觉潜在推理中的单令牌压缩

Bo Lv, Yasheng Sun, Junjie Wang, Haoxiang Shi

机构 * Tsinghua University(清华大学) Institute of Science Tokyo(东京科学研究所) Waseda University(早稻田大学)

专题命中 逻辑推理 :reasoning(title,abstract);chain-of-thought(abstract);CoT(abstract);logical reasoning(abstract)

AI总结 OneLatent通过将中间推理压缩为单个潜在令牌,提升了视觉推理效率,同时保持较高的准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.14224 2026-02-17 cs.SD cs.CL cs.MM 86%

The Interspeech 2026 Audio Reasoning Challenge: Evaluating Reasoning Process Quality for Audio Reasoning Models and Agents

Interspeech 2026音频推理挑战:评估音频推理模型和代理的推理过程质量

Ziyang Ma, Ruiyang Xu, Yinghao Ma, Chao-Han Huck Yang, Bohan Li, Jaeyeon Kim, Jin Xu, Jinyu Li, Carlos Busso, Kai Yu, Eng Siong Chng, Xie Chen

机构 * Shanghai Jiao Tong University(上海交通大学) Nanyang Technological University(南洋理工大学) Queen Mary University of London(伦敦大学Queen Mary) NVIDIA(NVIDIA公司) Carnegie Mellon University(卡内基梅隆大学) Qwen Team, Alibaba Group(通义实验室,阿里巴巴集团) Microsoft Corporation(微软公司)

专题命中 逻辑推理 :reasoning(title,abstract);chain-of-thought(abstract);CoT(abstract);分类 cs.CL

AI总结 Interspeech 2026音频推理挑战通过评估推理过程质量,探讨了音频推理模型和代理在事实性和逻辑性方面的表现及改进方向。

Comments The official website of the Audio Reasoning Challenge: https://audio-reasoning-challenge.github.io

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.14740 2026-02-17 cs.AI cs.CY cs.GT 79%

AI Arms and Influence: Frontier Models Exhibit Sophisticated Reasoning in Simulated Nuclear Crises

人工智能武器与影响:前沿模型在模拟核危机中展现出复杂的推理能力

Kenneth Payne

机构 * King’s College London(伦敦国王学院)

专题命中 逻辑推理 :reasoning(title,abstract);分类 cs.AI

AI总结 研究通过模拟核危机检验前沿AI模型的策略推理能力,发现其在复杂决策中展现出与人类相似的推理模式,但存在独特行为特征。

Comments 45 pages, 6 figures, 27 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.13324 2026-02-17 cs.CV cs.AI cs.RO 79%

Synthesizing the Kill Chain: A Zero-Shot Framework for Target Verification and Tactical Reasoning on the Edge

构建杀伤链:一种零样本框架,用于边缘节点上的目标验证和战术推理

Jesse Barkley, Abraham George, Amir Barati Farimani

机构 * With the Department of Mechanical Engineering, Carnegie Mellon University(卡内基梅隆大学机械工程系)

专题命中 逻辑推理 :reasoning(title,abstract);分类 cs.AI

AI总结 本文提出了一种零样本框架,通过边缘设备实现目标验证和战术推理,验证了分层架构在动态军事环境中的有效性。

Comments 8 Pages, 3 Figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.14130 2026-02-17 cs.AI cs.CL cs.LG 67%

Algebraic Quantum Intelligence: A New Framework for Reproducible Machine Creativity

代数量子智能:一种可重复的机器创造力新框架

Kazuo Yano, Jonghyeok Lee, Tae Ishitomi, Hironobu Kawaguchi, Akira Koyama, Masakuni Ota, Yuki Ota, Nobuo Sato, Keita Shimada, Sho Takematsu, Ayaka Tobinai, Satomi Tsuji, Kazunori Yanagi, Keiko Yano, Manabu Harada, Yuki Matsuda, Kazunori Matsumoto, Kenichi Matsumura, Hamae Matsuo, Yumi Miyazaki, Kotaro Murai, Tatsuya Ohshita, Marie Seki, Shun Tanoue, Tatsuki Terakado, Yuko Ichimaru, Mirei Saito, Akihiro Otsuka, Koji Ara

机构 * Happiness Planet, Ltd.(幸福星球有限公司) Hitachi, Ltd.(日立株式会社)

专题命中 逻辑推理 :reasoning(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文提出代数量子智能框架,通过非交换代数结构扩展语义空间,提升机器创造力的可重复性和表现。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.13419 2026-02-17 q-bio.QM cs.AI cs.CL cs.LG q-bio.BM 67%

Protect$^*$: Steerable Retrosynthesis through Neuro-Symbolic State Encoding

Protect$^*$: 通过神经符号状态编码实现可操控的逆合成

Shreyas Vinaya Sathyanarayana, Shah Rahil Kirankumar, Sharanabasava D. Hiremath, Bharath Ramsundar

机构 * Deep Forest Sciences(深林科技) Departament de Farmacologia, Toxicologia i Química Terapèutica, Universitat de Barcelona(巴塞罗那大学药理学、毒理学与治疗化学系) Institut de Nanociència i Nanotecnologia IN2UB, Universitat de Barcelona(巴塞罗那大学纳米科学与纳米技术研究所)

专题命中 逻辑推理 :reasoning(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 Protect$^*$通过神经符号状态编码实现逆合成的可控生成,结合规则推理与神经模型,提升化学合成路径的可靠性与准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.14890 2026-02-17 cs.AI 57%

Lifted Relational Probabilistic Inference via Implicit Learning

通过隐式学习实现提升的关系概率推断

Luise Ge, Brendan Juba, Kris Nilsson, Alison Shao

机构 * Washington University in St. Louis(华盛顿大学)

专题命中 逻辑推理 :reasoning(abstract);分类 cs.AI

AI总结 本文提出了一种基于隐式学习的方法,实现第一-order概率逻辑的隐式学习和提升推断,解决了传统方法在模型构建上的局限性。

详情

展开后加载摘要…

URL PDF HTML 收藏

4. 规划推理 48 篇

2602.14589 2026-02-17 cs.AI cs.CL cs.LG 89%

MATEO: A Multimodal Benchmark for Temporal Reasoning and Planning in LVLMs

MATEO:一种多模态基准,用于LVLMs中的时间推理和规划

Gabriel Roccabruna, Olha Khomyn, Giuseppe Riccardi

机构 * Signals and Interactive Systems Lab, University of Trento, Italy(特伦托大学信号与交互系统实验室) University of Trento(特伦托大学) Amazon(亚马逊)

专题命中 规划推理 :reasoning(title,abstract);planning(title,abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 MATEO是一个多模态基准,用于评估和提升大型视觉语言模型在时间推理和规划方面的能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.25260 2026-02-17 cs.AI cs.CL cs.LG 85%

Internal Planning in Language Models: Characterizing Horizon and Branch Awareness

语言模型中的内部规划:刻画视野与分支意识

Muhammed Ustaomeroglu, Baris Askin, Gauri Joshi, Carlee Joe-Wong, Guannan Qu

机构 * Department of Electrical and Computer Engineering(电气与计算机工程系) Carnegie Mellon University(卡内基梅隆大学)

专题命中 规划推理 :planning(title,abstract);chain-of-thought(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 研究通过分析语言模型内部计算结构,揭示规划视野与分支意识的特性,为理解模型内部动态提供通用工具。

Comments Accepted to ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.14003 2026-02-17 cs.AI 83%

Prompt-Driven Low-Altitude Edge Intelligence: Modular Agents and Generative Reasoning

基于提示的低空边缘智能:模块化代理与生成推理

Jiahao You, Ziye Jia, Chao Dong, Qihui Wu

专题命中 规划推理 :reasoning(title,abstract);planning(abstract);分类 cs.AI

AI总结 本文提出P2AECF框架,通过模块化代理和生成推理实现灵活、高效和适应的低空边缘智能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.11608 2026-02-17 cs.AI 83%

ParaCook: On Time-Efficient Planning for Multi-Agent Systems

ParaCook: 多智能体系统中高效时间规划的研究

Shiqi Zhang, Xinbei Ma, Yunqing Xu, Zouying Cao, Pengrui Lu, Haobo Yuan, Tiancheng Shen, Zhuosheng Zhang, Hai Zhao, Ming-Hsuan Yang

机构 * Shanghai Jiao Tong University(上海交通大学) University of California, Merced(加州大学梅尔德分校)

专题命中 规划推理 :planning(title,abstract);reasoning(abstract);分类 cs.AI

AI总结 ParaCook通过简化动作空间和烹饪任务实例化,为多智能体系统高效时间规划提供基准测试框架,评估LLMs在并行协调和高层次优化中的表现。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.14917 2026-02-17 cs.CL cs.AI 81%

BFS-PO: Best-First Search for Large Reasoning Models

BFS-PO:用于大规模推理模型的最佳优先搜索

Fiorenzo Parascandolo, Wenhui Tan, Enver Sangineto, Ruihua Song, Rita Cucchiara

机构 * Department of Engineering, University of Modena(Modena大学工程系) Gaoling School of Artificial Intelligence, Renmin University of China(中国人民大学北京校区人工智能学院)

专题命中 规划推理 :reasoning(title,abstract);分类 cs.CL、cs.AI

AI总结 BFS-PO是一种通过最佳优先搜索策略减少大规模推理模型过度思考问题的强化学习算法,提高了推理准确性和响应简洁性。

详情

展开后加载摘要…

URL PDF HTML 收藏