arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型推理能力

大模型数学、逻辑、规划、多步推理和测试时计算能力。

2026-02-02 至 2026-02-02 共收录 19 信号源:cs.CL, cs.AI, cs.LG

1. 规划推理 19 篇

2601.22311 2026-02-02 cs.AI cs.CL cs.LG 89%

Why Reasoning Fails to Plan: A Planning-Centric Analysis of Long-Horizon Decision Making in LLM Agents

为何推理无法规划:从规划角度分析LLM代理在长周期决策中的表现

Zehong Wang, Fang Wu, Hongru Wang, Xiangru Tang, Bolian Li, Zhenfei Yin, Yijun Ma, Yiyang Li, Weixiang Sun, Xiusi Chen, Yanfang Ye

机构 * University of Notre Dame(诺丁汉大学) Stanford University(斯坦福大学) Purdue University(普渡大学) University of Edinburgh(爱丁堡大学) University of Oxford(牛津大学) Yale University(耶鲁大学)

专题命中 规划推理 :reasoning(title,abstract);planning(title,abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文从规划角度分析LLM代理在长周期决策中的失败原因,提出FLARE方法通过前瞻和价值传播提升规划能力,使LLaMA-8B在多个基准中超越GPT-4o。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.22623 2026-02-02 cs.AI cs.MA 83%

SYMPHONY: Synergistic Multi-agent Planning with Heterogeneous Language Model Assembly

SYMPHONY:异构语言模型组装的协同多智能体规划

Wei Zhu, Zhiwen Tang, Kun Yue

机构 * School of Information Science and Engineering, Yunnan University, Kunming, China(信息科学与工程学院,云南大学,昆明,中国) Yunnan Key Laboratory of Intelligent Systems and Computing, Kunming, China(智能系统与计算云南重点实验室,昆明,中国)

专题命中 规划推理 :planning(title,abstract);reasoning(abstract);分类 cs.AI

AI总结 SYMPHONY通过整合异构语言模型的多智能体规划框架,提升探索能力与规划性能,实验证明其在复杂任务中的有效性。

Comments Accepted by NeurIPS 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.23163 2026-02-02 cs.LG cs.AI 81%

Probing the Trajectories of Reasoning Traces in Large Language Models

探究大型语言模型中推理轨迹的轨迹

Marthe Ballon, Brecht Verbeken, Vincent Ginis, Andres Algaba

机构 * Data Analytics Lab, Vrije Universiteit Brussel(自由大学布鲁塞尔数据分析实验室) imec-SMIT, Vrije Universiteit Brussel(imec-SMIT,自由大学布鲁塞尔) School of Engineering and Applied Sciences, Harvard University(哈佛大学工程与应用科学学院)

专题命中 规划推理 :reasoning(title,abstract);分类 cs.AI、cs.LG

AI总结 通过探究大型语言模型中推理轨迹的轨迹,研究发现随着推理token百分比增加,准确性和决策承诺提升,且相关内容驱动而非通用效应。

Comments 33 pages, 20 figures, 4 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.22545 2026-02-02 cs.RO cs.AI 79%

Adapting Reinforcement Learning for Path Planning in Constrained Parking Scenarios

在受限停车场景中适应强化学习用于路径规划

Feng Tao, Luca Paparusso, Chenyi Gu, Robin Koehler, Chenxu Wu, Xinyu Huang, Christian Juette, David Paz, Ren Liu

机构 * Bosch Research(博世研究)

专题命中 规划推理 :planning(title,abstract);分类 cs.AI

AI总结 本研究提出了一种深度强化学习框架,用于在受限停车场景中实现高效的实时路径规划,通过序列决策问题建模和新基准的开发,实现了更高的成功率和效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.22329 2026-02-02 cs.AI cs.CY 79%

Sparks of Rationality: Do Reasoning LLMs Align with Human Judgment and Choice?

理性之光:推理大语言模型是否与人类判断和选择一致?

Ala N. Tak, Amin Banayeeanzade, Anahita Bolourani, Fatemeh Bahrani, Ashutosh Chaubey, Sai Praneeth Karimireddy, Norbert Schwarz, Jonathan Gratch

专题命中 规划推理 :reasoning(title,abstract);分类 cs.AI

AI总结 研究评估了LLMs在理性选择和情感影响下的表现,发现有意识思考能提升理性,但情感引导方法在可控性与人类行为对齐间存在权衡。

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.11352 2026-02-02 cs.AI cs.FL 79%

Foundation Models for Logistics: Toward Certifiable, Conversational Planning Interfaces

物流领域的基础模型:迈向可验证、对话式规划界面

Yunhao Yang, Neel P. Bhatt, Christian Ellis, Samuel Li, Alvaro Velasquez, Zhangyang Wang, Ufuk Topcu

机构 * Neurosymbolic Intelligence(神经符号智能) The University of Texas at Austin(德克萨斯大学奥斯汀分校) University of Colorado Boulder(科罗拉多大学波德分校)

专题命中 规划推理 :planning(title,abstract);分类 cs.AI

AI总结 本文提出了一种基于神经符号框架的视觉-语言物流代理,通过自然语言对话和可验证保证实现可信赖的物流规划决策,模型在少量训练样本下实现了高效且准确的物流规划性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.22208 2026-02-02 cs.SE 78%

Stalled, Biased, and Confused: Uncovering Reasoning Failures in LLMs for Cloud-Based Root Cause Analysis

停滞、偏见和困惑:揭示LLM在基于云的根本原因分析中的推理失败

Evelien Riddell, James Riddell, Gengyi Sun, Michał Antkiewicz, Krzysztof Czarnecki

专题命中 规划推理 :reasoning(title,abstract)

AI总结 本文通过实证评估揭示LLM在基于云的根本原因分析中的推理失败,评估六种LLM在两种工作流程下的表现,识别16种常见推理失败类型,为未来推理驱动的系统诊断提供指导。

Comments FORGE 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.23266 2026-02-02 cs.RO cs.AI 74%

IRL-DAL: Safe and Adaptive Trajectory Planning for Autonomous Driving via Energy-Guided Diffusion Models

IRL-DAL:通过能量引导扩散模型实现自动驾驶的安全自适应轨迹规划

Seyed Ahmad Hosseini Miangoleh, Amin Jalal Aghdasian, Farzaneh Abdollahi

机构 * Department of Electrical Engineering, Amirkabir University of Technology (Tehran Polytechnic)(电气工程系,阿米尔卡比尔技术大学(德黑兰理工大学))

专题命中 规划推理 :planning(title);分类 cs.AI

AI总结 本文提出IRL-DAL框架,通过能量引导扩散模型实现自动驾驶的安全自适应轨迹规划,结合模仿学习与强化学习,提升行驶安全性和鲁棒性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.22338 2026-02-02 cs.HC cs.AI 74%

From Retrieving Information to Reasoning with AI: Exploring Different Interaction Modalities to Support Human-AI Coordination in Clinical Decision-Making

从信息检索到AI推理:探索不同交互方式以支持临床决策中的人类-AI协作

Behnam Rahdari, Sameer Shaikh, Jonathan H Chen, Tobias Gerstenberg, Shriti Raj

机构 * Stanford University Palo Alto CA USA Joseph Brant Hospital \& Foundation Ontario ON Canada Stanford University Joseph Brant Hospital \& Foundation

专题命中 规划推理 :reasoning(title);分类 cs.AI

AI总结 研究探讨了不同交互方式在临床决策支持中的应用,发现临床医生更倾向于使用工具进行信息检索而非主动协作,且交互方式的选择受个体认知风格影响。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.10691 2026-02-02 cs.CL cs.AI 73%

Evaluating from Benign to Dynamic Adversarial: A Squid Game for Large Language Models

从温和到动态对抗的评估:一个大型语言模型的鱿鱼游戏

Zijian Chen, Wenjun Zhang, Guangtao Zhai

机构 * Shanghai Jiao Tong University, Shanghai, China(上海交通大学) Shanghai AI Laboratory, Shanghai, China(上海人工智能实验室)

专题命中 规划推理 :reasoning(abstract);planning(abstract);分类 cs.CL、cs.AI

AI总结 本文提出鱿鱼游戏,一个动态对抗性评估环境,用于评估大型语言模型的多方面能力,并揭示静态基准中可能存在的评估范式污染问题。

Comments 31 pages, 15 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.22662 2026-02-02 cs.AI cs.MA 70%

Task-Aware LLM Council with Adaptive Decision Pathways for Decision Support

具有自适应决策路径的任务感知大语言模型委员会用于决策支持

Wei Zhu, Lixing Yu, Hao-Ren Yao, Zhiwen Tang, Kun Yue

专题命中 规划推理 :reasoning(abstract);planning(abstract);分类 cs.AI

AI总结 TALC通过任务感知的LLM委员会和自适应决策路径,提升决策支持任务的成功率和搜索效率。

Comments A shorter version of this work has been accepted by ICASSP 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.22491 2026-02-02 cs.CL 70%

SSL: Sweet Spot Learning for Differentiated Guidance in Agentic Optimization

SSL:在代理优化中差异化引导的甜蜜点学习

Jinyang Wu, Changpeng Yang, Yuhao Shen, Fangzhi Xu, Bolin Ni, Chonghua Liao, Yuchen Liu, Hongzhen Wang, Shuai Nie, Shuai Zhang, Haoran Luo, Jiaming Xu

机构 * Tsinghua University(清华大学) Xiaomi Corporation(小米公司) Zhejiang University(浙江大学) Nanyang Technological University(南洋理工大学) Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所)

专题命中 规划推理 :reasoning(abstract);planning(abstract);分类 cs.CL

AI总结 SSL通过分层奖励引导代理优化,提升解空间中的方向性优化,实现样本效率提升和跨任务迁移能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.23188 2026-02-02 cs.CL 57%

Deep Search with Hierarchical Meta-Cognitive Monitoring Inspired by Cognitive Neuroscience

受认知神经科学启发的深度搜索与分层元认知监控

Zhongxiang Sun, Qipeng Wang, Weijie Yu, Jingxuan Yang, Haolang Lu, Jun Xu

机构 * Gaoling School of Artificial Intelligence\ University of China Beijing China School of Information Technology Search Applications Department, Tencent Beijing China Beijing University of Posts Gaoling School of Artificial Intelligence\ University of China Search Applications Department, Tencent

专题命中 规划推理 :reasoning(abstract);分类 cs.CL

AI总结 本研究提出DS-MCM框架,通过分层元认知监控机制提升深度搜索的性能和鲁棒性。

Comments 11 pages, 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.10460 2026-02-02 cs.SE cs.AI 57%

Understanding and Bridging the Planner-Coder Gap: A Systematic Study on the Robustness of Multi-Agent Systems for Code Generation

理解并弥合规划者-生成者之间的差距:对多智能体系统在代码生成中鲁棒性的系统研究

Zongyi Lyu, Songqiang Chen, Zhenlan Ji, Liwen Wang, Shuai Wang, Daoyuan Wu, Wenxuan Wang, Shing-Chi Cheung

机构 * The Hong Kong University of Science and Technology(香港科技大学) Lingnan University(岭南大学) Renmin University of China(中国人民大学)

专题命中 规划推理 :planning(abstract);分类 cs.AI

AI总结 本文研究多智能体系统在代码生成中的鲁棒性问题,发现规划者与生成者之间的信息丢失是主要缺陷,并提出修复方法以提升系统鲁棒性。

Comments 18pages, 5 figures, 6 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2303.07435 2026-02-02 cs.AI 57%

Revealed Multi-Objective Utility Aggregation in Human Driving

揭示人类驾驶中的多目标效用聚合

Atrisha Sarkar, Kate Larson, Krzysztof Czarnecki

机构 * University of Toronto(多伦多大学) University of Waterloo(滑铁卢大学)

专题命中 规划推理 :reasoning(abstract);分类 cs.AI

AI总结 本文通过分析人类驾驶中的多目标效用聚合,提出基于理性化概念的算法,揭示了安全与进度效用的聚合机制及情境依赖性,并提升了行为模型的预测准确性。

Journal ref AAMAS '23: Proceedings of the 2023 International Conference on Autonomous Agents and Multiagent Systems Pages 1979 - 1987

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.22688 2026-02-02 cs.CL 57%

TSLM: Tree-Structured Language Modeling for Divergent Thinking

TSLM:用于发散思维的树状语言建模

Doyoung Kim, Jaehyeok Doo, Minjoon Seo

机构 * NYU(纽约大学) KAIST(韩国科学技术院)

专题命中 规划推理 :reasoning(abstract);分类 cs.CL

AI总结 TSLM通过树状结构语言建模实现发散思维,利用完整搜索树训练提升推理效率和鲁棒性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.22647 2026-02-02 cs.AI 57%

Test-Time Mixture of World Models for Embodied Agents in Dynamic Environments

动态环境中具身智能体的测试时间世界模型混合

Jinwoo Jang, Minjong Yoo, Sihyung Yoon, Honguk Woo

机构 * Department of Computer Science and Engineering(计算机科学与工程系) Sungkyunkwan University(庆尚大学)

专题命中 规划推理 :reasoning(abstract);分类 cs.AI

AI总结 TMoW通过测试时间更新路由函数,提升具身智能体在动态环境中的适应性与持续学习能力。

Comments Accepted at ICLR 2026. 10 pages. Code available at https://github.com/doldam0/tmow

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.12657 2026-02-02 cs.CL 57%

Synthetic Socratic Debates: Examining Persona Effects on Moral Decision and Persuasion Dynamics

合成苏格拉底辩论:考察人格对道德决策与说服动态的影响

Jiarui Liu, Yueqi Song, Yunze Xiao, Mingqian Zheng, Lindia Tjuatja, Jana Schaich Borg, Mona Diab, Maarten Sap

机构 * Carnegie Mellon University(卡内基梅隆大学) Duke University(杜克大学)

专题命中 规划推理 :reasoning(abstract);分类 cs.CL

AI总结 本文通过模拟AI-AI辩论研究人格对道德决策和说服效果的影响,发现政治意识形态和性格特质对辩论结果影响最大,且随着辩论进行,论证趋于温和。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.22517 2026-02-02 cs.RO 50%

RoboStriker: Hierarchical Decision-Making for Autonomous Humanoid Boxing

RoboStriker: 为自主人形 boxing 的分层决策

Kangning Yin, Zhe Cao, Wentao Dong, Weishuai Zeng, Tianyi Zhang, Qiang Zhang, Jingbo Wang, Jiangmiao Pang, Ming Zhou, Weinan Zhang

机构 * Shanghai Jiao Tong University(上海交通大学) Shanghai Artificial Intelligence Laboratory(上海人工智能实验室) Shanghai Innovation Institute(上海创新研究院) Peking University(北京大学) The Hong Kong University of Science and Technology (Guangzhou)(香港科学与技术大学(广州))

专题命中 规划推理 :reasoning(abstract)

AI总结 RoboStriker通过分层三阶段框架实现自主人形拳击,结合动作跟踪学习与潜在空间正则化,提升竞争性能和现实迁移能力。

详情

展开后加载摘要…

URL PDF HTML 收藏