Large Language Models Persuade Without Planning Theory of Mind
大语言模型无需规划即可说服理论之心理论
专题命中 规划推理 :planning(title,abstract);reasoning(abstract);分类 cs.CL
AI总结 大语言模型通过战略性揭示信息说服目标,无需显式理论之心推理,实验显示其在说服任务中表现优于人类。
AI 大模型
大模型数学、逻辑、规划、多步推理和测试时计算能力。
大语言模型无需规划即可说服理论之心理论
专题命中 规划推理 :planning(title,abstract);reasoning(abstract);分类 cs.CL
AI总结 大语言模型通过战略性揭示信息说服目标,无需显式理论之心推理,实验显示其在说服任务中表现优于人类。
Argus:面向长程推理的通用智能体运行时
机构 * Microsoft(微软公司) ; Shanghai Jiao Tong University(上海交通大学) ; Fudan University(复旦大学) ; Nanjing University(南京大学) ; Tsinghua University(清华大学) ; The University of Hong Kong(香港大学) ; Peking University(北京大学) ; The Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳)) ; Donghua University(东华大学)
专题命中 规划推理 :reasoning(title,abstract);verifier(abstract);分类 cs.AI
AI总结 Argus是面向长程推理的通用智能体运行时,通过多角色协作与自进化,在多个基准测试中表现优于同类方法,还完成了实际应用任务并产出结构化轨迹。
RareLens:通过对齐不同的大语言模型推理实现端到端罕见病护理
专题命中 规划推理 :reasoning(title,abstract);planning(abstract);分类 cs.AI
AI总结 针对罕见病诊断难题,RareLens系统利用不同大语言模型推理的差异,通过四个协同模块实现全病程临床决策支持,在真实数据集和外部研究中表现出色,证明对齐模型推理是高不确定性临床决策的有效策略。
Comments 100 pages 7 figures
TempoBench:评估大语言模型中的时间因果推理
机构 * Columbia University(哥伦比亚大学) ; Columbia University, Barnard College(哥伦比亚大学、巴纳德学院)
专题命中 规划推理 :reasoning(title,abstract);planning(abstract);分类 cs.AI
AI总结 提出TempoBench基准,通过合成Mealy机生成可验证的因果标签,评估LLM在时间因果推理中的表现,发现模型在最小因果归因任务上准确率低于25%,主要错误是过度指定。
用于长 horizon 双臂任务与运动规划的接地视觉语言解释器
机构 * OMRON SINIC X Corporation(OMRON SINIC X公司) ; The University of Tokyo(东京大学) ; University of Hamburg(汉堡大学)
专题命中 规划推理 :planning(title,abstract);reasoning(abstract);分类 cs.AI
AI总结 针对现有视觉语言机器人规划框架的黑箱缺陷与双臂任务探索不足问题,提出混合规划框架 ViLaIn-TAMP,经烹饪领域任务及实际双臂机器人系统验证,其性能优于基准方法。
Comments IROS 2026
PilotRL: 通过全局规划引导的渐进式强化学习训练语言模型代理
机构 * Peking University(北京大学) ; Huawei Cloud BU(华为云业务部)
专题命中 规划推理 :planning(title,abstract);reasoning(abstract);分类 cs.CL
AI总结 PilotRL通过全局规划引导的渐进式强化学习训练语言模型代理,提升长周期决策能力。
TableMind: 一种用于工具增强表格推理的自主程序化代理
机构 * State Key Laboratory of Cognitive Intelligence, University of Science and Technology of China(认知智能国家重点实验室,中国科学技术大学)
专题命中 规划推理 :reasoning(title,abstract);planning(abstract);分类 cs.AI
AI总结 TableMind通过两阶段训练策略提升表格推理能力,实现自主程序化代理的高效推理与代码生成。
Comments Comments: 10 pages, 6 figures. Submitted to WSDM 2026
用于动态机器人任务规划的视觉-语言-策略模型
机构 * Dynamic Robot Systems Group, Oxford Robotics Institute, University of Oxford(牛津大学机器人研究所动态机器人系统组) ; Humanoids and Human-Centered Mechatronics (HHCM), Istituto Italiano di Tecnologia(意大利技术研究所人形与以人为中心的机电系统)
专题命中 规划推理 :planning(title,abstract);reasoning(abstract);分类 cs.AI
AI总结 针对机器人在非结构化环境中自然语言命令与自主执行衔接难题,提出基于视觉-语言模型的VLP框架,能解释指令、整合推理生成行为策略,还可动态调整策略,实验证明其有强大规划自主性和跨实体泛化能力。
基于PDDLStream的任务与运动规划大语言模型的系统研究
机构 * Stony Brook University(石溪大学)
专题命中 规划推理 :planning(title,abstract);reasoning(abstract);分类 cs.AI
AI总结 研究大语言模型在机器人任务与运动规划中的应用,开发16种用LLMs替代关键TAMP组件的算法,通过实验发现基于LLM的规划器成功率低、规划时间长,提供几何细节会增加任务规划错误,多数情况下直接LLM变体表现更好。
Comments 2026 IEEE/RSJ International Conference on Intelligent Robots and Systems (IROS). 8 pages, 6 figures
LAPO:多轮搜索推理中自生成过程奖励的留一回合归因
机构 * Zhejiang University(浙江大学)
专题命中 规划推理 :reasoning(title,abstract);verifier(abstract);分类 cs.AI
AI总结 研究多轮搜索推理中强化学习依赖终端结果奖励的问题,提出基于反向留一回合归因的LAPO方法,无需额外模型,在七个问答数据集上取得较好成绩,证明策略追溯归因能为多轮搜索智能体提供有效过程监督。
Comments 20 pages, 5 figures
CXRAgent:用于胸部X光解读的由主任编排的多阶段推理
机构 * School of Computer Science, Hangzhou Dianzi University(杭州电子科技大学计算机科学学院) ; Department of Automation, Tsinghua University(清华大学自动化系) ; Department of Colorectal Medical Oncology, Zhejiang Cancer Hospital(浙江省肿瘤医院结直肠医学肿瘤科) ; School of Computer and Control Engineering, University of Chinese Academy of Sciences(中国科学院大学计算机与控制工程学院) ; School of Intelligence Science and Engineering, Harbin Institute of Technology (Shenzhen)(哈尔滨工业大学(深圳)智能科学与工程学院)
专题命中 规划推理 :reasoning(title,abstract);planning(abstract);分类 cs.AI
AI总结 针对胸部X光解读中模型适应性差等问题,提出CXRAgent,通过中央主任协调多阶段,包括工具调用、诊断规划和协作决策,实验证明该方法性能出色,能提供视觉证据并适应不同临床任务。
Comments 10 pages, 4 figures, 7 Tables
语言模型规划器无法扩展,但形式化器可以吗?
机构 * Drexel University(德雷克斯el大学) ; Allen Institute for AI(人工智能研究院)
专题命中 规划推理 :planning(title,abstract);reasoning(abstract);分类 cs.CL
AI总结 研究发现语言模型形式化器在规划问题中表现优于规划器,通过分治技术提升鲁棒性,并引入形式化挑战。
SpecEyes: 通过推测感知和规划加速代理多模态大语言模型
专题命中 规划推理 :planning(title,abstract);reasoning(abstract);分类 cs.CL
AI总结 SpecEyes通过推测规划框架减少代理多模态大语言模型的序列开销,提升并发性能,实验显示在保持准确性的同时实现1.1-3.35倍的加速。
Comments ECCV 2026, Code: https://github.com/MAC-AutoML/SpecEyes
从推理中寻找真理:一种用于引导LLM轨迹的动态表示编辑框架
机构 * ByteDance Inc.(字节跳动公司) ; Huawei Technologies Co., Ltd(华为技术有限公司) ; Peking University Information Technology Institute (Tianjin Binhai)(北京大学信息技术研究院(天津滨海))
专题命中 规划推理 :reasoning(title,abstract);chain-of-thought(abstract);分类 cs.AI
AI总结 提出DynaSteer动态表示编辑框架,通过模式聚类和Fisher-LDA提取纯净真理,并基于前瞻熵选择性引导轨迹,提升LLM推理真实性。
Comments Accepted by ICML'26
通过多依赖PIBT规划MAPF智能体依赖关系
机构 * University Of Melbourne(墨尔本大学) ; Robotics Institute, Carnegie Mellon University(卡内基梅隆大学机器人研究所)
专题命中 规划推理 :planning(title,abstract);reasoning(abstract);分类 cs.AI
AI总结 提出多依赖PIBT(MD-PIBT)框架,通过搜索智能体依赖关系来规划多智能体路径,在拥挤环境中高效处理多达10000个智能体,支持多种运动学约束。
Comments Accepted to IEEE/RSJ International Conference on Intelligent Robots and Systems (IROS) 2026
LWDrive: 基于逐层世界模型的视觉-语言模型自动驾驶规划
机构 * Chongqing University(重庆大学)
专题命中 规划推理 :planning(title,abstract);reasoning(abstract);分类 cs.AI
AI总结 提出LWDrive框架,通过逐层世界模型引导,将VLM输出的粗轨迹逐步细化为几何精确、多视角感知的规划轨迹,在NAVSIM基准上取得92.0分。
LLM进化的符号AI规划领域无关启发式
专题命中 规划推理 :planning(title,abstract);reasoning(abstract);分类 cs.AI
AI总结 本文使用进化搜索让大语言模型生成领域无关的启发式函数,在未见测试域上超越手工最优启发式,并首次系统评估了启发式的信息性-速度权衡。
Comments Accepted at the LM4Plan workshop at ICAPS 2026
RoboGPT-R1: 通过强化学习增强机器人任务规划
机构 * Institute of Automation, CASIA(中国科学院自动化研究所) ; School of Artificial Intelligence, UCAS(中国科学技术大学人工智能学院) ; Huawei Cloud Technology Co., Ltd(华为云技术有限公司)
专题命中 规划推理 :planning(title,abstract);reasoning(abstract);分类 cs.AI
AI总结 提出RoboGPT-R1两阶段微调框架,先监督学习获取基础知识,再通过强化学习提升视觉空间理解和推理能力,在EmbodiedBench上超越GPT-4o-mini 21.33%。
Journal ref Proceedings of the 25th International Conference on Autonomous Agents and Multiagent Systems (AAMAS 2026), pp. 2827-2837, IFAAMAS, 2026
RECON:基于压缩的推理用于高效检索增强生成
机构 * University of Utah(犹他大学) ; University of Washington(华盛顿大学) ; George Washington University(乔治·华盛顿大学) ; University of Virginia(弗吉尼亚大学) ; Shandong University(山东大学) ; Ludwig Maximilian University of Munich(慕尼黑路德维希-马克西米利安大学) ; University of Notre Dame(诺特丹大学)
专题命中 规划推理 :reasoning(title,abstract);分类 cs.CL
AI总结 提出RECON框架,在强化学习搜索代理的多轮推理中插入观察压缩器,通过两阶段课程训练实现上下文压缩,提升训练和推理效率并增强问答性能。
Comments Techinical report
基础模型时代中的具身机器人操作:规划与学习视角
机构 * Xi’an Jiaotong Univeristy(西安交通大学) ; Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州)) ; Chinese Academy of Sciences(中国科学院) ; Westlake University(西湖大学) ; Zhejiang University(浙江大学) ; University of Sydney(悉尼大学) ; BAAI(百度人工智能研究院) ; Peking University(北京大学)
专题命中 规划推理 :planning(title,abstract);reasoning(abstract)
AI总结 本文探讨了基础模型时代机器人操作的规划与学习方法,分析了高层推理与低层控制的统一框架,并提出了未来研究方向。
Comments This work is a re-architected core derived from the full survey (arXiv:2510.10903), refined to highlight the most central themes and representative studies
Afford-X:面向任务型操作的通用且轻量化的可供性推理模型
机构 * Institute for Artificial Intelligence, Peking University(北京大学人工智能研究院) ; Department of Computer Science and Engineering, Hong Kong University of Science and Technology(香港科技大学计算机科学与工程系) ; Shenyang Institute of Automation, Chinese Academy of Sciences(中国科学院沈阳自动化研究所) ; Institute for Al Industry Research, Tsinghua University(清华大学人工智能产业研究院) ; Department of Computer Science, Tsinghua University(清华大学计算机科学系)
专题命中 规划推理 :reasoning(title,abstract);planning(abstract)
AI总结 研究人员推出LVIS-Aff数据集,开发了Afford-X可供性推理模型,其性能优于现有非LLM方法和此前会议论文结果,参数紧凑、推理速度快,可部署于本地设备助力机器人任务导向型操作。
任何房屋任何任务:为抽象人类任务的可扩展长周期规划
专题命中 规划推理 :planning(title,abstract);reasoning(abstract)
AI总结 AHAT是一种优化长周期规划的家庭任务规划器,通过结合LLM和TGPO算法,在复杂家庭任务中实现高效规划。
代理视频生成:通过工具约束的LLM规划从文本到可执行事件图
机构 * Institute of Mathematics of the Romanian Academy(罗马尼亚科学院数学研究所) ; National University of Science and Technology Politehnica Bucharest(布加勒斯特理工大学) ; Büchi Labortechnik AG(布奇实验室技术股份公司)
专题命中 规划推理 :planning(title,abstract);reasoning(abstract)
AI总结 本文提出了一种代理系统,通过LLM生成结构化的事件图规范,并在3D引擎中确定性执行,解决了传统视频生成的语义可靠性问题,展示了在物理真实性和语义对齐上的优越表现。
闭环言语强化学习用于任务级机器人规划
机构 * Intelligent Space Robotics Laboratory, Skolkovo Institute of Science and Technology(智能空间机器人实验室,斯克尔科夫科学与技术研究所)
专题命中 规划推理 :planning(title,abstract);reasoning(abstract)
AI总结 提出闭环言语强化学习框架,通过大语言模型与视觉语言模型交互,在符号规划层迭代优化行为树,实现可解释的任务级规划与执行不确定性下的自适应。
Comments Accepted to IEEE/RSJ International Conference on Intelligent Robots and Systems (IROS) 2026
UniDrive-WM:面向自动驾驶的统一理解、规划和生成世界模型
机构 * Bosch Research North America & Bosch Center for Artificial Intelligence (BCAI)(博世北美研究院与博世人工智能中心) ; Washington University in St. Louis(圣路易斯华盛顿大学) ; Arizona State University(亚利桑那州立大学) ; Case Western Reserve University(凯斯西储大学)
专题命中 规划推理 :planning(title,abstract);reasoning(abstract)
AI总结 提出UniDrive-WM,一个基于VLM的统一世界模型,联合执行场景理解、轨迹规划和未来图像生成,在Bench2Drive上轨迹误差降低7.3%,碰撞率降低10.4%。
Comments Accepted to ECCV 2026. Project Page: https://unidrive-wm.github.io/UniDrive-WM
面向园艺机器人的视觉-语言引导任务规划
机构 * the Siebel School of Computing and Data Science(塞比尔计算与数据科学学院) ; the Department of Agricultural and Biological Engineering(农业与生物工程系) ; National Center for Supercomputing Applications(国家超级计算中心)
专题命中 规划推理 :planning(title,abstract);reasoning(abstract)
AI总结 提出一种模块化框架,利用视觉语言模型(VLM)主动查询异构数据源来引导机器人任务规划,在单作和混作环境中进行短期和长期作物监测任务基准测试,发现零样本VLM在短期任务中表现稳健(成功率87%),但长期多目标任务成功率低于10%,且依赖噪声语义地图时性能下降。
Comments 18 pages, 6 figures
隐喻是大推理模型跨领域失调的根源
机构 * The University of New South Wales(新南威尔士大学) ; CSIRO Data61(澳大利亚联邦科学与工业研究组织数据61)
专题命中 规划推理 :reasoning(title,abstract);分类 cs.CL、cs.AI、cs.LG
AI总结 研究发现训练数据中的隐喻会导致大推理模型在推理输出中出现跨领域失调,通过隐喻干预可显著改变失调程度,并设计出高精度检测器。
Comments 19 pages, 6 figures
探索-执行链:迈向高效的结构化推理范式
机构 * Qizhi Institute(启智研究院) ; Dept. of Computer Science, Tsinghua University(清华大学计算机科学系) ; College of AI, Tsinghua University(清华大学人工智能学院) ; Engineering Department, National University of Singapore(新加坡国立大学工程系) ; Dept. of Automation, Shanghai Jiao Tong University(上海交通大学自动化系) ; IIIS, Tsinghua University(清华大学人工智能研究院) ; College of Software, Northeastern University(东北大学软件学院)
专题命中 规划推理 :reasoning(title);planning(abstract);分类 cs.CL、cs.AI、cs.LG
AI总结 提出探索-执行链(E²C),将推理分为随机探索阶段(生成简洁高层计划)和确定性执行阶段(忠实执行计划),通过因果SFT和RL训练分离,在AIME'2024上以更少token超越思维树,并支持轻量领域适应。
AlignDrive: 用于端到端自动驾驶的对齐横向-纵向规划
机构 * School of Software Engineering, XJTU(软件工程学院,西安交通大学) ; Horizon Robotics ; Shenzhen Loop Area Institute(深圳河套学院) ; University of Chinese Academy of Sciences(中国科学院大学)
专题命中 规划推理 :planning(title,abstract);reasoning(abstract)
AI总结 本文提出一种 cascaded 框架,通过将纵向规划转化为路径条件推理过程,提升自动驾驶的协调性和安全性。方法引入锚点回归设计和规划导向的数据增强策略,实现在 Bench2Drive 上达到 SOTA 性能。
Comments underreview
Branch-and-Browse:具有树状推理与动作记忆的高效可控网页探索
机构 * University of Michigan(密歇根大学) ; Alibaba Group(阿里巴巴集团) ; McMaster University(麦马斯特大学)
专题命中 规划推理 :reasoning(title,abstract);分类 cs.CL、cs.AI、cs.LG
AI总结 提出Branch-and-Browse框架,通过树状结构化推理、网页状态重放和页面动作记忆,实现LLM网页代理的高效可控多分支探索,在WebArena上成功率35.8%,执行时间降低40.4%。