arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型推理能力

大模型数学、逻辑、规划、多步推理和测试时计算能力。

共收录 45417 信号源:cs.CL, cs.AI, cs.LG

1. 规划推理 11104 篇

2605.01657 2026-05-05 cs.CV 87%

Act2See: Emergent Active Visual Perception for Video Reasoning

Act2See:面向视频推理的涌现式主动视觉感知

Martin Q. Ma, Yuxiao Qu, Aditya Agrawal, Willis Guo, Paul Pu Liang, Ruslan Salakhutdinov, Louis-Philippe Morency

机构 * Carnegie Mellon University(卡内基梅隆大学) MIT(麻省理工学院)

专题命中 规划推理 :reasoning(title,abstract);CoT(abstract,abstract_cn);chain-of-thought(abstract)

AI总结 本文提出Act2See框架,通过使VLMs在文本推理中主动交错视频帧,实现视频推理中的主动视觉感知,提升了推理质量并优于现有方法。

Comments CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.28116 2026-03-31 cs.RO cs.CV 87%

$AutoDrive\text{-}P^3$: Unified Chain of Perception-Prediction-Planning Thought via Reinforcement Fine-Tuning

$AutoDrive\text{-}P^3$:通过强化微调实现感知-预测-规划统一链式推理

Yuqi Ye, Zijian Zhang, Junhong Lin, Shangkun Sun, Changhao Peng, Wei Gao

机构 * School of Electronic and Computer Engineering, Peking University(北京大学电子与计算机工程学院)

专题命中 规划推理 :planning(title,abstract);reasoning(abstract);chain-of-thought(abstract);CoT(abstract)

AI总结 本文提出$AutoDrive\text{-}P^3$框架,通过结构化推理整合感知、预测和规划,引入$P^3\text{-}CoT$数据集和$P^3\text{-}GRPO$算法,实现端到端自动驾驶的高效决策与安全规划。

Comments Accepted at ICLR 2026 (International Conference on Learning Representations)

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.02436 2026-03-04 cs.CR 87%

TraceGuard: Process-Guided Firewall against Reasoning Backdoors in Large Language Models

TraceGuard: 用于对抗大语言模型推理后门的过程引导防火墙

Zhen Guo, Shanghao Shi, Hao Li, Shamim Yazdani, Ning Zhang, Reza Tourani

专题命中 规划推理 :reasoning(title,abstract);chain-of-thought(abstract);CoT(abstract);verifier(abstract)

AI总结 TraceGuard通过过程引导框架提升大语言模型的推理安全性,有效对抗推理后门。

Comments 20 pages,10 figures,6 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.21952 2026-02-26 cs.CV 87%

MindDriver: Introducing Progressive Multimodal Reasoning for Autonomous Driving

MindDriver: 引入渐进多模态推理用于自动驾驶

Lingjun Zhang, Yujian Yuan, Changjie Wu, Xinyuan Chang, Xin Cai, Shuang Zeng, Linzhe Shi, Sijin Wang, Hang Zhang, Mu Xu

机构 * Amap, Alibaba Group(阿里集团蚂巴公司) The Hong Kong University of Science and Technology(香港科学与技术大学) The Chinese University of Hong Kong(香港中文大学) Xi’an Jiaotong University(西安交通大学)

专题命中 规划推理 :reasoning(title,abstract);chain-of-thought(abstract);CoT(abstract);planning(abstract)

AI总结 MindDriver通过渐进多模态推理框架提升自动驾驶系统的推理能力,实现语义到物理空间的转化与轨迹规划,展现优异的性能表现。

Comments CVPR2026; Yujian Yuan and Lingjun Zhang contributed equally with random order

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.06176 2026-01-13 cs.CV 87%

TIR-Flow: Active Video Search and Reasoning with Frozen VLMs

TIR-Flow:基于冻结视频语言模型的主动视频搜索与推理

Hongbo Jin, Siyi Xie, Jiayu Ding, Kuanwei Lin, Ge Li

机构 * School of Electronic and Computer Engineering, Peking University(电子与计算机工程学院,北京大学)

专题命中 规划推理 :reasoning(title,abstract);chain-of-thought(abstract);CoT(abstract);logical reasoning(abstract)

AI总结 TIR-Flow通过三个协同模块实现冻结视频语言模型的主动视频搜索与推理,显著提升性能并拓展长视界视频推理能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.14404 2025-12-30 cs.CV 87%

ViC-Bench: Benchmarking Visual-Interleaved Chain-of-Thought Capability in MLLMs with Free-Style Intermediate State Representations

ViC-Bench: 用自由式中间状态表示法对多模态大语言模型的视觉交错链式思维能力进行基准测试

Xuecheng Wu, Jiaxing Liu, Danlei Huang, Yifan Wang, Yunyun Shi, Kedi Chen, Junxiao Xue, Yang Liu, Chunlin Chen, Hairong Dong, Dingkang Yang

机构 * School of Computer Science and Technology, Xi’an Jiaotong University(西安交通大学计算机科学与技术学院) Meituan Inc.(美团公司) Institute of Advanced Technology, University of Science and Technology of China(中国科学技术大学先进技术研究院) School of Computer Science and Technology, East China Normal University(华东师范大学计算机科学与技术学院) Research Center for Space Computing System, Zhejiang Lab(浙江实验室空间计算系统研究中心) College of Electronic and Information Engineering, Tongji University(同济大学电子与信息工程学院) School of Robotics and Automation, Nanjing University(南京大学机器人与自动化学院) College of Intelligent Robotics and Advanced Manufacturing, Fudan University(复旦大学智能机器人与先进制造学院)

专题命中 规划推理 :chain-of-thought(title,abstract);reasoning(abstract);CoT(abstract);planning(abstract)

AI总结 ViC-Bench 通过自由式中间状态表示法,系统评估多模态大语言模型的视觉交错链式思维能力,涵盖四个任务并提出新评估指标。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.09679 2025-12-11 cs.SE 87%

Understanding Chain-of-Thought Effectiveness in Code Generation: An Empirical and Information-Theoretic Analysis

理解链式思维在代码生成中的有效性:一项经验性与信息论分析

Naizhu Jin, Zhong Li, Guang Yang, Tian Zhang, Qingkai Zeng

专题命中 规划推理 :chain-of-thought(title,abstract);reasoning(abstract);CoT(abstract);planning(abstract)

AI总结 本研究通过经验分析和信息论方法,揭示了链式思维在代码生成中有效性的影响因素,发现结构化CoT在提升生成质量方面表现更优,且其效果受语言系统和模型容量影响。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.01830 2025-12-03 cs.CV 87%

OpenREAD: Reinforced Open-Ended Reasoning for End-to-End Autonomous Driving with LLM-as-Critic

OpenREAD: 基于LLM作为批评者的开放性推理端到端自动驾驶框架

Songyan Zhang, Wenhui Huang, Zhan Chen, Chua Jiahao Collister, Qihang Huang, Chen Lv

机构 * Nanyang Technological University, Singapore(南洋理工大学) Harvard University, USA(哈佛大学)

专题命中 规划推理 :reasoning(title,abstract);chain-of-thought(abstract);CoT(abstract);planning(abstract)

AI总结 OpenREAD通过端到端强化微调框架,结合LLM作为批评者,提升自动驾驶中的推理与规划能力,实现从高层推理到低层轨迹规划的全面优化。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.25420 2025-10-01 cs.AI cs.CL cs.LG 87%

Adaptive Test-Time Reasoning via Reward-Guided Dual-Phase Search

Yingqian Cui, Zhenwei Dai, Pengfei He, Bing He, Hui Liu, Xianfeng Tang, Jingying Zeng, Suhang Wang, Yue Xing, Jiliang Tang, Benoit Dumoulin

机构 * Michigan State University(密歇根州立大学) Amazon(亚马逊) Pennsylvania State University(宾夕法尼亚州立大学)

专题命中 规划推理 :reasoning(title,abstract);math reasoning(abstract);planning(abstract);分类 cs.CL、cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.23511 2025-02-11 cs.CL cs.AI cs.LG 87%

Dynamic Strategy Planning for Efficient Question Answering with Large Language Models

Tanmay Parekh, Pradyot Prakash, Alexander Radovic, Akshay Shekher, Denis Savenkov

专题命中 规划推理 :planning(title,abstract);reasoning(abstract);chain-of-thought(abstract);分类 cs.CL、cs.AI、cs.LG

Comments Accepted at NAACL 2025 Findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2406.13094 2024-11-05 cs.CL cs.AI cs.LG 87%

Exploring and Benchmarking the Planning Capabilities of Large Language Models

Bernd Bohnet, Azade Nova, Aaron T Parisi, Kevin Swersky, Katayoon Goshvadi, Hanjun Dai, Dale Schuurmans, Noah Fiedel, Hanie Sedghi

专题命中 规划推理 :planning(title,abstract);reasoning(abstract);chain-of-thought(abstract);分类 cs.CL、cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2408.13890 2024-08-27 cs.CV 87%

Making Large Language Models Better Planners with Reasoning-Decision Alignment

Zhijian Huang, Tao Tang, Shaoxiang Chen, Sihao Lin, Zequn Jie, Lin Ma, Guangrun Wang, Xiaodan Liang

专题命中 规划推理 :reasoning(title,abstract);chain-of-thought(abstract);CoT(abstract);planning(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2309.07694 2023-09-15 cs.CL cs.AI cs.LG 87%

Tree of Uncertain Thoughts Reasoning for Large Language Models

Shentong Mo, Miao Xin

专题命中 规划推理 :reasoning(title,abstract);chain-of-thought(abstract);planning(abstract);分类 cs.CL、cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.27622 2026-05-28 cs.AI cs.SC 86%

Reasoning and Planning with Dynamically Changing Norms

动态变化规范的推理与规划

Taylor Olson, Roberto Salas-Damian, Kenneth D. Forbus

机构 * University of Iowa(爱荷华大学) Northwestern University(西北大学)

专题命中 规划推理 :planning(title,abstract);reasoning(title);分类 cs.AI

AI总结 本文提出一种在人类-AI环境中使用动态变化规范引导规划的方法,通过可废止演算解决规范冲突并将规范作为规划护栏,理论证明与对话任务实验验证了有效性。

Comments 8 pages, 1 figure, dataset included in anc

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.14899 2026-03-04 cs.RO cs.CL 86%

REFLEX: Metacognitive Reasoning for Reflective Zero-Shot Robotic Planning with Large Language Models

REFLEX:基于大语言模型的反思零样本机器人规划的元认知推理

Wenjie Lin, Jin Wei-Kocsis, Jiansong Zhang, Byung-Cheol Min, Dongming Gan, Paul Asunda, Ragu Athinarayanan

机构 * School of Applied and Creative Computing, Purdue University(应用与创意计算学院,普渡大学) Bowen School of Construction, Purdue University(建设学院,普渡大学) School of Engineering Technology, Purdue University(工程技术学院,普渡大学) Department of Technology Leadership and Innovation, Purdue University(技术领导与创新部门,普渡大学)

专题命中 规划推理 :planning(title,abstract);reasoning(title);分类 cs.CL

AI总结 REFLEX通过引入元认知学习,提升大语言模型在机器人任务中的推理、反思与创造力,实现零样本下的高效规划。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.07456 2025-10-10 cs.AI 86%

ExpertAgent: Enhancing Personalized Education through Dynamic Planning and Retrieval-Augmented Long-Chain Reasoning

Binrong Zhu, Guiran Liu, Nina Jiang

机构 * Department of Computer Science(计算机科学系) San Francisco State University(旧金山州立大学) Department of Mechanical & Industrial Engineering(机械与工业工程系) Louisiana State University(路易斯安那州立大学)

专题命中 规划推理 :planning(title,abstract);reasoning(title);分类 cs.AI

Comments Manuscript previously submitted to the NeurIPS 2025 Workshop on Bridging Language, Agent, and World Models (LAW 2025)

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.00054 2025-09-09 cs.RO cs.AI 86%

Robotic Fire Risk Detection based on Dynamic Knowledge Graph Reasoning: An LLM-Driven Approach with Graph Chain-of-Thought

Haimei Pan, Jiyun Zhang, Qinxi Wei, Xiongnan Jin, Chen Xinkai, Jie Cheng

专题命中 规划推理 :reasoning(title);chain-of-thought(title);planning(abstract);分类 cs.AI

Comments We have decided to withdraw this paper as the work is still undergoing further refinement. To ensure the clarity of the results, we prefer to make additional improvements before resubmission. We appreciate the readers' understanding

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.02722 2025-09-09 cs.AI 86%

Planning with Reasoning using Vision Language World Model

Delong Chen, Theo Moutakanni, Willy Chung, Yejin Bang, Ziwei Ji, Allen Bolourchi, Pascale Fung

机构 * Meta FAIR

专题命中 规划推理 :planning(title,abstract);reasoning(title);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.23589 2025-08-01 cs.RO cs.AI 86%

Can LLM-Reasoning Models Replace Classical Planning? A Benchmark Study

Kai Goebel, Patrik Zips

机构 * Center for Vision, Automation & Control(视觉、自动化与控制中心) AIT Austrian Institute of Technology GmbH(奥地利技术研究院)

专题命中 规划推理 :planning(title,abstract);reasoning(title);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.07236 2025-05-13 cs.RO cs.AI 86%

UAV-CodeAgents: Scalable UAV Mission Planning via Multi-Agent ReAct and Vision-Language Reasoning

Oleg Sautenkov, Yasheerah Yaqoot, Muhammad Ahsan Mustafa, Faryal Batool, Jeffrin Sam, Artem Lykov, Chih-Yung Wen, Dzmitry Tsetserukou

机构 * Intelligent Space Robotics Laboratory, Center for Digital Engineering, Skolkovo Institute of Science and Technology(斯克尔科沃科学与技术研究所)

专题命中 规划推理 :planning(title,abstract);reasoning(title);分类 cs.AI

Comments Submitted

详情

展开后加载摘要…

URL PDF HTML 收藏
2210.08879 2022-10-18 cs.RO cs.AI cs.HC 86%

Robust Planning for Human-Robot Joint Tasks with Explicit Reasoning on Human Mental State

Anthony Favier, Shashank Shekhar, Rachid Alami

专题命中 规划推理 :planning(title,abstract);reasoning(title);分类 cs.AI

Comments 10 pages, 2 figures, 1 table, AI-HRI AAAI 2022 Fall Symposium Series

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.08633 2026-06-09 cs.AI cs.LG 新提交 86%

Towards Long-Horizon Vessel Trajectory and Destination Forecasting with Reasoning Large Language Models

面向长时域船舶轨迹与目的地预测的推理型大语言模型

Hongwei Wang, Miao Zhou, Fengde Wang, Yuting Wang, Jiewen Yu, Jun-Yan He, Bohao Qu, Wanbing Zhang, Xiuju Fu, Qing Guo, Zipei Fan, Yingying Xing, Yi Yuan

机构 * Institute of High Performance Computing (IHPC), A*STAR, Singapore(新加坡科技研究局高性能计算研究所) The Key Laboratory of Road and Traffic Engineering, Ministry of Education, Tongji University(同济大学道路与交通工程教育部重点实验室) Meituan Inc., Shenzhen, China(美团(深圳)) Centre for Frontier AI Research (CFAR), A*STAR, Singapore(新加坡科技研究局前沿人工智能研究中心) Nankai University(南开大学) School of Artificial Intelligence, Jilin University(吉林大学人工智能学院)

专题命中 规划推理 :reasoning(title,abstract);planning(abstract);verifier(abstract);分类 cs.AI、cs.LG

AI总结 提出基于可验证奖励强化学习(RLVR)的Maritime LLM后训练框架,将轨迹转化为语义文本,通过物理有效性约束和层次匹配提升长时域(30天)预测精度,4B模型表现最优。

Comments The IEEE International Conference on Intelligent Transportation Systems (ITSC) 2026, Naples, Italy

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.07248 2026-05-11 cs.CL cs.LG 86%

PaT: Planning-after-Trial for Efficient Test-Time Code Generation

PaT:在试后进行规划以实现高效的测试时间代码生成

Youngsik Yoon, Sungjae Lee, Seockbean Song, Siwei Wang, Wei Chen, Jungseul Ok

机构 * Department of Computer Science and Engineering, POSTECH, South Korea(韩国POSTECH计算机科学与工程系) Graduate School of Artificial Intelligence, POSTECH, South Korea(韩国POSTECH人工智能研究生院) Microsoft Research Asia, Beijing, China(中国北京微软亚洲研究院)

专题命中 规划推理 :planning(title,abstract);reasoning(abstract);test-time compute(abstract);分类 cs.CL、cs.LG

AI总结 本文提出PaT方法,通过在试后规划来提高测试时间代码生成的效率,采用异构模型配置在多个基准和模型家族中显著提升了成本性能帕累托前沿。

Comments Accepted to ACL 2026 main conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.02910 2026-04-06 cs.AI cs.CL 86%

Analysis of Optimality of Large Language Models on Planning Problems

大型语言模型在规划问题中的最优性分析

Bernd Bohnet, Michael C. Mozer, Kevin Swersky, Wil Cunningham, Aaron Parisi, Kathleen Kenealy, Noah Fiedel

专题命中 规划推理 :planning(title,abstract);reasoning(abstract);logical reasoning(abstract);分类 cs.CL、cs.AI

AI总结 本文研究了大型语言模型在规划问题中的最优性,通过Blocksworld领域和Path-Star图任务,发现增强推理的LLM在复杂多目标配置中显著优于传统规划器,且能精确跟踪理论最优限。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.24142 2026-03-09 cs.CL cs.AI 86%

CoME: Empowering Channel-of-Mobile-Experts with Informative Hybrid-Capabilities Reasoning

CoME:赋能移动专家的 informative hybrid-capabilities 推理

Yuxuan Liu, Weikai Xu, Kun Huang, Changyu Chen, Jiankun Zhao, Pengzhi Gao, Wei Liu, Jian Luan, Shuo Shang, Bo Du, Ji-Rong Wen, Rui Yan

机构 * ruc(中国人民大学人工智能学院) xiaomi(小米公司) ntu(南洋理工大学) whu(武汉大学)

专题命中 规划推理 :reasoning(title,abstract);CoT(abstract);planning(abstract);分类 cs.CL、cs.AI

AI总结 CoME 通过四种专家架构和渐进训练策略,实现移动代理混合能力推理的解耦增强与平衡优化。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.22072 2026-02-26 cs.CL cs.AI 86%

Understanding Artificial Theory of Mind: Perturbed Tasks and Reasoning in Large Language Models

理解人工智能理论 of mind:受扰任务和大语言模型中的推理

Christian Nickel, Laura Schrewe, Florian Mai, Lucie Flek

机构 * Bonn-Aachen International Center for Information Technology (b-it)(波恩-埃森国际信息科技中心) University of Bonn(波恩大学) Lamarr Institute for Machine Learning and Artificial Intelligence(拉马尔机器学习与人工智能研究所) Research Center Trustworthy Data Science and Security (RC-Trust)(可信数据科学与安全研究中心) University of Duisburg-Essen(埃森-杜伊斯堡大学)

专题命中 规划推理 :reasoning(title,abstract);chain-of-thought(abstract);CoT(abstract);分类 cs.CL、cs.AI

AI总结 本研究通过扰动任务和链式推理提示探讨大语言模型的理论 of mind能力,发现其鲁棒性受扰动影响显著,CoT提示虽提升整体表现,但对某些扰动类别却降低准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.03994 2026-02-10 cs.LG cs.AI 86%

Bypassing the Rationale: Causal Auditing of Implicit Reasoning in Language Models

绕过理由:语言模型中隐式推理的因果审计

Anish Sathyanarayanan, Aditya Nagarsekar, Aarush Rathore

机构 * Birla Institute of Technology and Science, Pilani, K. K. Birla Goa Campus(比拉理工学院和科学学院,比里拉班加尔学院)

专题命中 规划推理 :reasoning(title,abstract);chain-of-thought(abstract);CoT(abstract);分类 cs.AI、cs.LG

AI总结 本文通过因果审计揭示语言模型中隐式推理的可信度差异,发现CoT的因果影响在模型和任务间存在显著变化,需通过逐层审计来验证。

Comments Under Review at ICLR, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.09609 2026-01-15 cs.CL cs.AI 86%

DPWriter: Reinforcement Learning with Diverse Planning Branching for Creative Writing

DPWriter: 基于多样化规划分支的强化学习用于创造性写作

Qian Cao, Yahui Liu, Wei Bi, Yi Zhao, Ruihua Song, Xiting Wang, Ruiming Tang, Guorui Zhou, Han Li

机构 * Renmin University of China(中国人民大学) Kuaishou Technology(快手科技)

专题命中 规划推理 :planning(title,abstract);chain-of-thought(abstract);CoT(abstract);分类 cs.CL、cs.AI

AI总结 DPWriter通过多样化规划分支方法提升创造性写作的输出多样性,同时保持生成质量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.05455 2026-01-12 cs.AI cs.LG 86%

ART: Adaptive Reasoning Trees for Explainable Claim Verification

ART:可解释性声明验证的自适应推理树

Sahil Wadhwa, Himanshu Kumar, Guanqun Yang, Abbaas Alif Mohamed Nishar, Pranab Mohanty, Swapnil Shinde, Yue Wu

机构 * Capital One Stevens Institute of Technology(史蒂文斯理工学院)

专题命中 规划推理 :reasoning(title,abstract);chain-of-thought(abstract);CoT(abstract);分类 cs.AI、cs.LG

AI总结 ART通过自适应推理树提升声明验证的可解释性和可靠性,通过分层论证结构和法官LLM裁决实现透明且可挑战的决策。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.01912 2025-12-09 cs.MA cs.AI cs.LG 86%

EvoMem: Improving Multi-Agent Planning with Dual-Evolving Memory

EvoMem:通过双进化记忆提升多智能体规划

Wenzhe Fan, Ning Yan, Masood Mortazavi

机构 * University of Illinois Chicago(伊利诺伊大学芝加哥分校) Futurewei Technologies(未来科技)

专题命中 规划推理 :planning(title,abstract);reasoning(abstract);verifier(abstract);分类 cs.AI、cs.LG

AI总结 EvoMem通过双进化记忆机制提升多智能体规划,利用约束记忆和查询反馈记忆模块优化约束跟踪与错误修正,实现旅行、会议和日历任务的性能提升。

详情

展开后加载摘要…

URL PDF HTML 收藏