arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型推理能力

大模型数学、逻辑、规划、多步推理和测试时计算能力。

共收录 45417 信号源:cs.CL, cs.AI, cs.LG

1. 规划推理 11104 篇

2602.21198 2026-05-26 cs.LG cs.AI cs.CL cs.CV cs.RO 85%

Learning from Trials and Errors: Reflective Test-Time Planning for Embodied LLMs

从试错中学习:具身大语言模型的反思式测试时规划

Yining Hong, Huang Huang, Manling Li, Li Fei-Fei, Leonidas Guibas, Jiajun Wu, Yejin Choi

机构 * Stanford University(斯坦福大学) Northwestern University(西北大学)

专题命中 规划推理 :planning(title,abstract);reasoning(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 提出反思式测试时规划方法,通过行动中反思和行动后反思两种模式,结合回溯性反思,使具身智能体在测试时进行自我纠正和经验积累,显著提升长程任务性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.16205 2026-05-18 cs.AI cs.CL cs.LG cs.MA cs.SY eess.SY 85%

Context, Reasoning, and Hierarchy: A Cost-Performance Study of Compound LLM Agent Design in an Adversarial POMDP

上下文、推理与层次:在对抗性POMDP中的复合LLM代理设计成本-性能研究

Igor Bogdanov, Chung-Horng Lung, Thomas Kunz, Jie Gao, Adrian Taylor, Marzia Zaman

机构 * Carleton University(卡尔顿大学)

专题命中 规划推理 :reasoning(title,abstract);chain-of-thought(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 研究探讨了在对抗性部分可观测序贯环境中,复合LLM代理设计的上下文、推理和层次分解对性能与成本的影响,发现程序化状态抽象在成本效率上表现最佳,而分层分解无需推理可获得最佳性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.07776 2026-05-11 cs.LG cs.AI cs.CL 85%

Tracing Uncertainty in Language Model "Reasoning"

追踪语言模型推理中的不确定性

Nils Grünefeld, Bertram Højer, Philipp Mondorf, Barbara Plank, Anna Rogers, Christian Hardmeier, Stefan Heinrich, Jes Frellsen

机构 * Data Science Section, IT University of Copenhagen(丹麦哥本哈根技术大学数据科学部门) MaiNLP, Center for Information and Language Processing, LMU Munich(慕尼黑大学信息与语言处理中心MaiNLP) Department of Applied Mathematics and Computer Science, Technical University of Denmark(丹麦技术大学应用数学与计算机科学系) Pioneer Centre for Artificial Intelligence(先锋人工智能中心) Munich Center for Machine Learning (MCML)(慕尼黑机器学习中心(MCML))

专题命中 规划推理 :reasoning(title,abstract);chain-of-thought(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 研究通过不确定性量化分析语言模型推理轨迹,发现其不确定性特征可预测最终答案正确性,且早期即可检测错误。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.07745 2026-04-21 cs.CL cs.AI cs.LG 85%

Parallel Test-Time Scaling for Latent Reasoning Models

潜在推理模型的并行测试时缩放

Runyang You, Yongqi Li, Meng Liu, Wenjie Wang, Liqiang Nie, Wenjie Li

机构 * Hong Kong Polytechnic University(香港理工大学) Shandong Jianzhu University(山东建筑大学) University of Science and Technology of China(中国科学技术大学) Harbin Institute of Technology (Shenzhen)(哈尔滨工业大学(深圳))

专题命中 规划推理 :reasoning(title,abstract);chain-of-thought(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文提出通过改进采样和聚合方法,使潜在推理模型能有效利用并行测试时缩放,提升连续空间中的推理能力。

Comments Accepted at ACL 2026 Main Conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.01062 2026-04-10 cs.CL cs.AI cs.LG 85%

SealQA: Raising the Bar for Reasoning in Search-Augmented Language Models

SealQA: 提升搜索增强语言模型在事实性问题中的推理能力

Thinh Pham, Nguyen Nguyen, Pratibha Zunjare, Weiyuan Chen, Yu-Min Tseng, Tu Vu

机构 * Virginia Tech(弗吉尼亚理工大学)

专题命中 规划推理 :reasoning(title,abstract);test-time compute(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 SealQA是一个新的挑战性基准,用于评估搜索增强语言模型在事实性问题上的能力,揭示当前模型在处理冲突、噪声或无用搜索结果时的局限性。

Comments Camera Ready version for ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.21272 2026-03-24 cs.AI cs.CL cs.DS cs.LG 85%

The Library Theorem: How External Organization Governs Agentic Reasoning Capacity

图书馆定理:外部组织如何支配代理推理能力

Zachary F. Mainen

机构 * Champalimaud Foundation(Champalimaud基金会)

专题命中 规划推理 :reasoning(title,abstract);chain-of-thought(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文探讨了外部组织对代理推理能力的影响,通过实验验证了索引外部记忆的代理在检索效率上的优势,并指出语言模型在索引构建与导航协议执行中的分离需求。

Comments 19 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.11409 2026-02-23 cs.LG cs.AI cs.CL cs.CV 85%

Visual Planning: Let's Think Only with Images

视觉规划:只用图像来思考

Yi Xu, Chengzu Li, Han Zhou, Xingchen Wan, Caiqi Zhang, Anna Korhonen, Ivan Vulić

机构 * Language Technology Lab, University of Cambridge(剑桥大学语言技术实验室) Google(谷歌公司)

专题命中 规划推理 :planning(title,abstract);reasoning(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文提出视觉规划范式,通过图像进行推理,优于纯文本推理,在视觉导航任务中表现更优。

Comments ICLR 2026 (Oral)

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.25260 2026-02-17 cs.AI cs.CL cs.LG 85%

Internal Planning in Language Models: Characterizing Horizon and Branch Awareness

语言模型中的内部规划:刻画视野与分支意识

Muhammed Ustaomeroglu, Baris Askin, Gauri Joshi, Carlee Joe-Wong, Guannan Qu

机构 * Department of Electrical and Computer Engineering(电气与计算机工程系) Carnegie Mellon University(卡内基梅隆大学)

专题命中 规划推理 :planning(title,abstract);chain-of-thought(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 研究通过分析语言模型内部计算结构,揭示规划视野与分支意识的特性,为理解模型内部动态提供通用工具。

Comments Accepted to ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.18282 2026-02-09 cs.AI cs.CL cs.LG 85%

Think-Augmented Function Calling: Improving LLM Parameter Accuracy Through Embedded Reasoning

思考增强的功能调用:通过嵌入式推理提高LLM参数准确性

Lei Wei, Xiao Peng, Jinpeng Ou, Bin Wang

机构 * Alibaba International Digital Commerce Group(阿里巴巴国际数字商业集团) School of Software and Microelectronics(软件与微电子学院) Peking University(北京大学)

专题命中 规划推理 :reasoning(title,abstract);chain-of-thought(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 TAFC通过嵌入式推理提升LLM参数准确性,实现函数调用的显式推理和细粒度优化,增强多参数函数的生成准确性和可解释性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.02873 2026-02-04 cs.CV 85%

ViThinker: Active Vision-Language Reasoning via Dynamic Perceptual Querying

ViThinker: 通过动态感知查询实现主动视觉-语言推理

Weihang You, Qingchan Zhu, David Liu, Yi Pan, Geng Yuan, Hanqi Jiang

机构 * School of Computing, University of Georgia(计算机学院,佐治亚大学) School of Engineering and Applied Science, Princeton University(工程与应用科学学院,普林斯顿大学)

专题命中 规划推理 :reasoning(title,abstract);chain-of-thought(abstract);CoT(abstract)

AI总结 ViThinker通过动态感知查询实现主动视觉-语言推理,提升感知基础和推理准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.20194 2026-01-29 cs.HC 85%

An Autonomous Agent Framework for Feature-Label Extraction from Device Dialogues and Automatic Multi-Dimensional Device Hosting Planning Based on Large Language Models

基于大语言模型的自主代理框架:用于设备对话中特征-标签提取与自动多维设备托管规划

Huichao Men, Yizhen Hu, Yu Gao, Xiaofeng Mou, Yi Xu, Xinhua Xiao

专题命中 规划推理 :planning(title,abstract);reasoning(abstract);chain-of-thought(abstract)

AI总结 本文提出AirAgent框架,利用大语言模型实现家庭空气系统的自主管理,通过双层协作架构提升空气质量和用户体验。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.08468 2026-01-14 cs.CL cs.AI cs.LG 85%

JudgeRLVR: Judge First, Generate Second for Efficient Reasoning

JudgeRLVR: 先判后生成以实现高效推理

Jiangshan Duo, Hanyu Li, Hailin Zhang, Yudong Wang, Sujian Li, Liang Zhao

机构 * State Key Laboratory of Multimedia Information Processing, School of Computer Science, Peking University(多媒体信息处理国家重点实验室,计算机学院,北京大学) CFCS, School of Computer Science, Peking University(计算机学院,北京大学) LLM-Core Xiaomi(小智LLM核心)

专题命中 规划推理 :reasoning(title,abstract);planning(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 JudgeRLVR通过先判后生成的双阶段方法,提升大型语言模型在数学领域内的推理效率与准确性。

Comments 16 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.23314 2026-01-08 cs.AI cs.CL cs.LG cs.MA 85%

SPIO: Ensemble and Selective Strategies via LLM-Based Multi-Agent Planning in Automated Data Science

SPIO:基于LLM的多智能体规划的集成与选择策略在自动化数据科学中的应用

Wonduk Seo, Juhyeon Lee, Yanjun Shao, Qingshan Zhou, Seunghyun Lee, Yi Bu

机构 * Enhans Peking University(北京大学) Yale University(耶鲁大学)

专题命中 规划推理 :planning(title,abstract);reasoning(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 SPIO通过基于LLM的多智能体规划,在自动化数据科学中实现了集成与选择策略,提升了流程的灵活性和准确性。

Comments Under Review

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.09284 2025-12-23 cs.AI cs.CL cs.LG 85%

Tree-OPO: Off-policy Monte Carlo Tree-Guided Advantage Optimization for Multistep Reasoning

Tree-OPO: 用于多步推理的逆政策蒙特卡洛树引导优势优化

Bingning Huang, Tu Nguyen, Matthieu Zimmer

专题命中 规划推理 :reasoning(title,abstract);verifier(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 Tree-OPO通过引入分阶段优势估计框架,利用MCTS生成轨迹优化策略学习,提升数学推理任务的准确性与样本效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.09349 2025-12-11 cs.RO 85%

COVLM-RL: Critical Object-Oriented Reasoning for Autonomous Driving Using VLM-Guided Reinforcement Learning

COVLM-RL:基于VLM引导强化学习的自动驾驶中关键对象导向推理

Lin Li, Yuxin Cai, Jianwu Fang, Jianru Xue, Chen Lv

机构 * School of Mechanical and Aerospace Engineering, Nanyang Technological University(南洋理工大学机械与航空航天工程学院) National Key Laboratory of Human-Machine Hybrid Augmented Intelligence, National Engineering Research Center for Visual Information and Applications, Institute of Artificial Intelligence and Robotics, Xi’an Jiaotong University(西安交通大学人机混合增强智能国家重点实验室、视觉信息与应用国家工程研究中心、人工智能与机器人研究院)

专题命中 规划推理 :reasoning(title,abstract);chain-of-thought(abstract);CoT(abstract)

AI总结 COVLM-RL通过结合关键对象导向推理与VLM引导强化学习,提升了自动驾驶系统的泛化能力和训练效率。

Comments 8 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.13757 2025-11-07 cs.CV 85%

AutoVLA: A Vision-Language-Action Model for End-to-End Autonomous Driving with Adaptive Reasoning and Reinforcement Fine-Tuning

Zewei Zhou, Tianhui Cai, Seth Z. Zhao, Yun Zhang, Zhiyu Huang, Bolei Zhou, Jiaqi Ma

机构 * University of California, Los Angeles(加州大学洛杉矶分校)

专题命中 规划推理 :reasoning(title,abstract);chain-of-thought(abstract);planning(abstract)

Comments NeurIPS 2025; Website link:https://autovla.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.17109 2025-10-21 cs.CL cs.AI cs.LG cs.MA 85%

Verification-Aware Planning for Multi-Agent Systems

Tianyang Xu, Dan Zhang, Kushan Mitra, Estevam Hruschka

机构 * Purdue University, USA(普渡大学,美国) Megagon Labs, USA(梅加隆实验室,美国)

专题命中 规划推理 :planning(title,abstract);reasoning(abstract);分类 cs.CL、cs.AI、cs.LG

Comments Submission for ARR Oct

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.16767 2025-10-21 cs.RO 85%

T3 Planner: A Self-Correcting LLM Framework for Robotic Motion Planning with Temporal Logic

Jia Li, Guoxiang Zhao

专题命中 规划推理 :planning(title,abstract);reasoning(abstract);verifier(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.15244 2025-10-21 cs.CL cs.AI cs.LG 85%

Planner and Executor: Collaboration between Discrete Diffusion And Autoregressive Models in Reasoning

Lina Berrayana, Ahmed Heakl, Muhammad Abdullah Sohail, Thomas Hofmann, Salman Khan, Wei Chen

机构 * EPFL(苏黎世联邦理工学院) MBZUAI(马克斯·普朗克人工智能研究所) ETH Zürich(苏黎世联邦理工学院) Microsoft Research Asia(微软亚洲研究院)

专题命中 规划推理 :reasoning(title,abstract);planning(abstract);分类 cs.CL、cs.AI、cs.LG

Comments Under Submission

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.25852 2025-10-01 cs.RO 85%

Reinforced Embodied Planning with Verifiable Reward for Real-World Robotic Manipulation

Zitong Bo, Yue Hu, Jinming Ma, Mingliang Zhou, Junhui Yin, Yachen Kang, Yuqi Liu, Tong Wu, Diyun Xiang, Hao Chen

机构 * Xiaomi Robotics Lab(小米机器人实验室) College of Computer Science and Technology, Zhejiang University(浙江大学计算机科学与技术学院)

专题命中 规划推理 :planning(title,abstract);reasoning(abstract);chain-of-thought(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.11420 2025-09-16 q-fin.TR cs.AI cs.CE cs.CL cs.LG 85%

Trading-R1: Financial Trading with LLM Reasoning via Reinforcement Learning

Yijia Xiao, Edward Sun, Tong Chen, Fang Wu, Di Luo, Wei Wang

专题命中 规划推理 :reasoning(title,abstract);planning(abstract);分类 cs.CL、cs.AI、cs.LG

Comments Tauric Research: https://github.com/TauricResearch

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.03864 2025-08-08 cs.AI cs.CL cs.LG 85%

DOTS: Learning to Reason Dynamically in LLMs via Optimal Reasoning Trajectories Search

Murong Yue, Wenlin Yao, Haitao Mi, Dian Yu, Ziyu Yao, Dong Yu

机构 * George Mason University(乔治·马歇尔大学) Tencent AI Lab(腾讯AI实验室)

专题命中 规划推理 :reasoning(title,abstract);planning(abstract);分类 cs.CL、cs.AI、cs.LG

Comments Accepted to ICLR 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.00669 2025-08-04 cs.CL cs.AI cs.CV cs.LG 85%

Medical Reasoning in the Era of LLMs: A Systematic Review of Enhancement Techniques and Applications

Wenxuan Wang, Zizhan Ma, Meidan Ding, Shiyi Zheng, Shengyuan Liu, Jie Liu, Jiaming Ji, Wenting Chen, Xiang Li, Linlin Shen, Yixuan Yuan

机构 * Renmin University of China(中国人民大学) The Chinese University of Hong Kong(香港中文大学) Shenzhen University(深圳大学) City University of Hong Kong(香港城市大学) Peking University(北京大学) Massachusetts General Hospital and Harvard Medical School(麻省总医院和哈佛医学院)

专题命中 规划推理 :reasoning(title,abstract);planning(abstract);分类 cs.CL、cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.08224 2025-07-22 cs.RO 85%

Making VLMs More Robot-Friendly: Self-Critical Distillation of Low-Level Procedural Reasoning

Chan Young Park, Jillian Fisher, Marius Memmel, Dipika Khullar, Seoho Yun, Abhishek Gupta, Yejin Choi

专题命中 规划推理 :reasoning(title,abstract);chain-of-thought(abstract);planning(abstract)

Comments Code Available: https://github.com/chan0park/SelfReVision

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.12728 2025-06-17 cs.SE 85%

MCTS-Refined CoT: High-Quality Fine-Tuning Data for LLM-Based Repository Issue Resolution

Yibo Wang, Zhihao Peng, Ying Wang, Zhao Wei, Hai Yu, Zhiliang Zhu

专题命中 规划推理 :CoT(title,abstract);reasoning(abstract);chain-of-thought(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.12119 2025-05-26 cs.AI cs.CL cs.LG 85%

Mastering Board Games by External and Internal Planning with Language Models

John Schultz, Jakub Adamek, Matej Jusup, Marc Lanctot, Michael Kaisers, Sarah Perrin, Daniel Hennes, Jeremy Shar, Cannada Lewis, Anian Ruoss, Tom Zahavy, Petar Veličković, Laurel Prince, Satinder Singh, Eric Malmi, Nenad Tomašev

专题命中 规划推理 :planning(title,abstract);reasoning(abstract);分类 cs.CL、cs.AI、cs.LG

Comments 70 pages, 10 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.20595 2025-04-30 cs.AI cs.CL cs.IR cs.LG 85%

ReasonIR: Training Retrievers for Reasoning Tasks

Rulin Shao, Rui Qiao, Varsha Kishore, Niklas Muennighoff, Xi Victoria Lin, Daniela Rus, Bryan Kian Hsiang Low, Sewon Min, Wen-tau Yih, Pang Wei Koh, Luke Zettlemoyer

机构 * FAIR at Meta(Meta的FAIR) University of Washington(华盛顿大学) National University of Singapore(新加坡国立大学) Singapore-MIT Alliance for Research(新加坡-麻省理工联合研究联盟) Allen Institute for Artificial Intelligence(人工智能研究所) Stanford University(斯坦福大学) Massachusetts Institute of Technology(麻省理工学院) University of California, Berkeley(加州大学伯克利分校)

专题命中 规划推理 :reasoning(title,abstract);test-time compute(abstract);分类 cs.CL、cs.AI、cs.LG

Comments Our code is released at \url{https://github.com/facebookresearch/ReasonIR}

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.16506 2025-03-24 cs.HC 85%

Enhancing Post-Merger Integration Planning through AI-Assisted Dependency Analysis and Path Generation

Lars Malmqvist

专题命中 规划推理 :planning(title,abstract);reasoning(abstract);chain-of-thought(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.19500 2025-02-28 cs.AI cs.CL cs.HC cs.LG 85%

Conversational Planning for Personal Plans

Konstantina Christakopoulou, Iris Qu, John Canny, Andrew Goodridge, Cj Adams, Minmin Chen, Maja Matarić

专题命中 规划推理 :planning(title,abstract);reasoning(abstract);分类 cs.CL、cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2403.03101 2025-02-25 cs.CL cs.AI cs.HC cs.LG cs.MA 85%

KnowAgent: Knowledge-Augmented Planning for LLM-Based Agents

Yuqi Zhu, Shuofei Qiao, Yixin Ou, Shumin Deng, Shiwei Lyu, Yue Shen, Lei Liang, Jinjie Gu, Huajun Chen, Ningyu Zhang

专题命中 规划推理 :planning(title,abstract);reasoning(abstract);分类 cs.CL、cs.AI、cs.LG

Comments NAACL 2025 Findings. Project page: https://zjunlp.github.io/project/KnowAgent/ Code: https://github.com/zjunlp/KnowAgent

详情

展开后加载摘要…

URL PDF HTML 收藏