On The Planning Abilities of OpenAI's o1 Models: Feasibility, Optimality, and Generalizability
专题命中 规划推理 :planning(title,abstract);reasoning(abstract);分类 cs.AI、cs.LG
Comments Code available at https://github.com/VITA-Group/o1-planning
AI 大模型
大模型数学、逻辑、规划、多步推理和测试时计算能力。
专题命中 规划推理 :planning(title,abstract);reasoning(abstract);分类 cs.AI、cs.LG
Comments Code available at https://github.com/VITA-Group/o1-planning
专题命中 规划推理 :planning(title,abstract);reasoning(abstract);分类 cs.AI、cs.LG
Comments Website: https://hierarchical-planning-foundation-model.github.io/
专题命中 规划推理 :planning(title,abstract);reasoning(abstract);分类 cs.AI、cs.LG
Comments This work will appear in the Proceedings of the 32nd International Conference on Automated Planning and Scheduling (ICAPS2022) https://icaps22.icaps-conference.org/papers
当我们谈论大语言模型规划时我们在谈论什么:两种不同规划能力的证据
机构 * Faculty of Information Technology, Monash University(莫纳什大学信息技术学院)
专题命中 规划推理 :planning(title,abstract);reasoning(abstract,comments);分类 cs.AI
AI总结 研究大语言模型规划任务性能差异原因,通过在ACPBench-Hard上评估多个模型家族,应用多维项目反应理论模型,发现操作推理和结构枚举两个塑造规划性能的维度,推动大语言模型规划的能力层面评估。
Comments 19 pages. Keywords: Reasoning, Automated Planning, Item Responses Theory, LLMs as Planner Research Area: NLP and Symbolic Reasoning Research Area Keywords: neurosymbolic, planning in agents, symbolic reasoning Contribution Types: Model analysis & interpretability
AdaptR1:基于强化学习的自适应交错思考在多跳问答中的应用
机构 * Computer Science, Fudan University(复旦大学计算机科学系) ; Institute of Modern Languages and Linguistics, Fudan University(复旦大学现代语言与语言学研究院) ; Shanghai Innovation Institute(上海创新研究院) ; Soochow University(苏州大学)
专题命中 规划推理 :CoT(abstract,abstract_cn);reasoning(abstract);chain-of-thought(abstract);planning(abstract)
AI总结 提出AdaptR1框架,通过强化学习动态分配每步推理预算,减少多跳问答中的过度思考,在保持性能的同时显著降低推理成本。
GSAM: 一种通用且安全的铰接物体操作机器人框架
机构 * College of Computer Science, Chongqing University, Chongqing, China(重庆大学计算机学院) ; Lumos Robotics, China(Lumos机器人中国) ; Xi'an Jiaotong-Liverpool University, China(西安交通大学利物浦大学) ; Fudan University, China(复旦大学) ; Department of Information Engineering and Computer Science, University of Trento, Trento, Italy(特伦托大学信息工程与计算机科学系)
专题命中 规划推理 :CoT(abstract,abstract_cn);reasoning(abstract);chain-of-thought(abstract);planning(abstract)
AI总结 提出GSAM框架,通过视觉感知器生成运动学参数、基于VLM的细调器进行常识推理修正、交互约束函数生成器集成障碍物避免知识,并由运动学感知规划器验证轨迹可达性,在50个铰链任务上相比最佳基线将标准差降低3.1%、操作成功率提升36.0%。
Comments Accepted by the 19th International Conference on Parallel Problem Solving from Nature (PPSN 2026)
MiMo-Embodied:X-Embodied基础模型技术报告
机构 * Xiaomi Embodied Intelligence Team(小米具身智能团队)
专题命中 规划推理 :CoT(summary_cn,abstract);planning(abstract);分类 cs.CL
AI总结 MiMo-Embodied是首个跨具身基础模型,成功整合并实现自动驾驶和具身AI领域的最先进性能,在17个具身AI基准和12个自动驾驶基准中均取得新纪录,通过多阶段学习、数据构建和CoT/RL微调实现领域间的强正迁移。
Comments Code: https://github.com/XiaomiMiMo/MiMo-Embodied | Model: https://huggingface.co/XiaomiMiMo/MiMo-Embodied-7B
机构 * Amazon(亚马逊)
专题命中 规划推理 :planning(title,abstract);reasoning(abstract,comments);分类 cs.AI
Comments 4 pages, 2 figures, short paper, NeurIPS 2025 workshop on Bridging Language, Agent, and World Models for Reasoning and Planning
专题命中 规划推理 :reasoning(title);planning(title);分类 cs.AI
Comments 8 pages, 7 figures
追逐即课程,捕获锚定信用:用于零数据大语言模型推理的追逃自博弈
专题命中 规划推理 :reasoning(title,abstract);verifier(abstract);分类 cs.CL、cs.LG
AI总结 本研究提出LURE框架,将零数据自博弈转化为追逃博弈,通过捕获锚定信用机制,在三类推理环境和主干模型上,实现优于先进基线的零数据LLM推理性能。
Comments 9 pages, 5 figures, 5 tables
机器人何时应该思考?基于强化学习的资源感知推理在具身机器人决策中的应用
机构 * Robotics Institute, Carnegie Mellon University(卡内基梅隆大学机器人研究所) ; Northeastern University(东北大学) ; Harvard University(哈佛大学) ; Cornell University(康奈尔大学) ; MIT(麻省理工学院) ; Fujitsu Research of America(美国富士通研究) ; Tsinghua University(清华大学) ; Peking University(北京大学) ; University of Georgia(佐治亚大学) ; Florida International University(佛罗里达国际大学) ; EmbodyX Inc(EmbodyX公司) ; Cisco Systems(思科系统)
专题命中 规划推理 :reasoning(title,abstract);planning(abstract);分类 cs.AI、cs.LG
AI总结 提出RARRL框架,通过强化学习学习高层编排策略,使具身代理能自适应决定是否调用LLM推理、选择推理角色及分配计算预算,以平衡推理开销与任务成功率。
Why2Speak:弃权(不执行)策略的忠实推理
专题命中 规划推理 :reasoning(title,abstract);chain-of-thought(abstract);分类 cs.CL、cs.AI
AI总结 该研究针对智能体需在行动与弃权间选择的问题,以多方对话干预为场景,对比多种策略,发现能力与可审计性的权衡,分析现有方法缺陷并提供监督评估的控制方法。
不确定性作为规划信号:面向目标导向对话的多轮决策
机构 * The Ohio State University(俄亥俄州立大学)
专题命中 规划推理 :planning(title,abstract);分类 cs.CL、cs.AI
AI总结 本文提出CUP框架,通过结合语言模型与结构化规划,解决目标导向对话中不确定性与信息获取之间的平衡问题,提升对话成功率并减少交互轮次。
Comments COLM 2026
SIMMER: 基于世界模型评估LLM可执行规划中的潜在故障
机构 * The Pennsylvania State University(宾夕法尼亚州立大学)
专题命中 规划推理 :planning(title,abstract);reasoning(abstract);分类 cs.CL、cs.AI
AI总结 提出SIMMER基准,通过人工策划的厨房领域符号世界模型,评估LLM规划中的潜在故障;实验发现前沿模型最多17%无错误计划,56%含潜在故障,多数不可逆;反事实预演可减少72%潜在故障和75%不可逆案例。
Comments Accepted at COLM 2026
CRAFT: 通过强化学习进行多跳问答的校准推理与答案忠实轨迹
专题命中 规划推理 :reasoning(title,abstract);planning(abstract);分类 cs.CL、cs.LG
AI总结 CRAFT通过强化学习框架提升多跳问答的推理准确性和答案忠实度,结合确定性奖励和判官奖励,增强推理轨迹的可审计性与语义一致性。
从证据到轨迹:用于检索增强生成智能体开发的溯因推理路径合成
机构 * The Chinese University of Hong Kong, Sha Tin, NT, Hong Kong(香港中文大学) ; Université de Montréal, Montréal, Quebéc, Canada(蒙特利尔大学) ; McGill University, Montréal, Quebéc, Canada(麦吉尔大学) ; Mila - Quebéc AI Institute, Montréal, Quebéc, Canada(魁北克AI研究院) ; Huawei Noah’s Ark Lab, Montréal, Quebéc, Canada(华为诺亚实验室)
专题命中 规划推理 :reasoning(title,abstract);planning(abstract);分类 cs.CL、cs.AI
AI总结 针对检索增强生成智能体开发缺乏可执行轨迹问题,提出EviPath范式,通过溯因子任务规划、忠实子问题回答、对话微调三个阶段合成推理路径,实验表明基于此训练的模型在开放域问答中显著优于基线。
Comments KDD 2026 Research Track
Git辅助工具:基于规划的Git仓库更新支持
机构 * AI Research, JPMorganChase(人工智能研究,摩根大通)
专题命中 规划推理 :planning(title,abstract);reasoning(abstract);分类 cs.CL、cs.AI
AI总结 研究针对git工具对开发者有挑战的问题,提出结合大语言模型与自动规划的Git-Assistant,经合成和随机git环境评估,证明该方法能提升仓库管理可靠性、减少错误,展现混合人工智能方法在开发者辅助上的潜力。
Comments Pending permissions from the private company
Tool-MCoT:用于内容安全审核的工具增强多模态链式思维
机构 * Stanford University(斯坦福大学) ; Google(谷歌) ; Google DeepMind(谷歌DeepMind)
专题命中 规划推理 :chain-of-thought(title,abstract);reasoning(abstract);分类 cs.CL、cs.AI
AI总结 本文提出Tool-MCoT,一种基于工具增强的多模态链式思维模型,用于提升内容安全审核的效率与准确性,通过训练小语言模型以有效利用外部工具进行推理和决策。
APIVOT:具有交错视觉语言思维的自适应规划
机构 * Stanford University(斯坦福大学)
专题命中 规划推理 :planning(title,abstract);reasoning(abstract);分类 cs.AI、cs.LG
AI总结 研究长期机器人规划问题,提出基于VLM的APIVOT规划器,通过自适应交错语言和视觉思维,利用语言语义推理、视觉思维验证几何可行性,在长期厨房任务中表现出色,提升了规划成功率和推理效率。
Comments Project Page: https://emilyzjin.github.io/projects/apivot.html
面向LLM智能体规划的自我进化世界模型
机构 * National University of Singapore(国立新加坡大学) ; Singapore University of Technology and Design(新加坡科技设计大学) ; Singapore Management University(新加坡管理学院)
专题命中 规划推理 :planning(title,abstract);reasoning(abstract);分类 cs.CL、cs.AI
AI总结 提出WorldEvolver框架,通过情景记忆、语义记忆和选择性预见三个模块在测试时修正世界模型,提升预测准确性和下游规划成功率。
CostBench:评估LLM工具使用代理在动态环境中的多轮成本最优规划与适应
机构 * Hong Kong University of Science and Technology(香港科技大学) ; University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) ; Tsinghua University(清华大学)
专题命中 规划推理 :planning(title,abstract);reasoning(abstract);分类 cs.CL、cs.AI
AI总结 本文提出CostBench,一个以成本为中心的可扩展基准,用于评估LLM代理在动态环境中的经济推理和重新规划能力,揭示现有模型在成本感知规划方面的显著不足。
MAGNIFIED: 多模态大语言模型的强化学习微调用于运动规划
机构 * Waymo LLC(Waymo有限责任公司)
专题命中 规划推理 :planning(title,abstract);reasoning(abstract);分类 cs.AI、cs.LG
AI总结 提出MAGNIFIED方法,通过强化学习微调多模态大语言模型,利用令牌级奖励优化规划目标,在Waymo数据集上显著降低重叠率和偏离道路率。
Journal ref ICRA 2026
MedAI: 评估 TxAgent 在 NeurIPS CURE-Bench 竞赛中的治疗性智能推理
机构 * L3S Research Center(L3S研究中心)
专题命中 规划推理 :reasoning(title,abstract);planning(abstract);分类 cs.AI、cs.LG
AI总结 本文介绍 TxAgent,一种通过迭代检索增强生成和统一生物医学工具集进行治疗决策的智能AI方法,并在CURE-Bench竞赛中评估其推理质量,通过改进工具检索策略提升性能,荣获开放科学卓越奖。
Comments 7 pages, 3 figures
CRANE:通过空域编辑实现代码代理的约束推理注入
机构 * Rensselaer Polytechnic Institute(拉特格斯理工学院) ; IBM Research(IBM研究院)
专题命中 规划推理 :reasoning(title,abstract);planning(abstract);分类 cs.CL、cs.AI
AI总结 CRANE通过空域编辑技术,结合推理和工具使用能力,提升代码代理性能,在多个基准测试中取得显著成果。
RetroReasoner:一种用于战略 retrosynthesis 预测的推理 LLM
机构 * Department of Artificial Intelligence, Korea University(韩国大学人工智能系) ; Department of Statistics, Korea University(韩国大学统计系) ; Materials Intelligence Lab, LG AI Research(LG人工智能研究实验室)
专题命中 规划推理 :reasoning(title,abstract);planning(abstract);分类 cs.AI、cs.LG
AI总结 RetroReasoner 通过监督微调和强化学习,捕捉化学家基于断键策略的推理过程,提升 retrosynthesis 预测的准确性和多样性。
Comments 35 pages, 19 figures
寻找隐式推理的最小参数预算:一种基于数据复杂度的语言模型缩放定律
机构 * University of California, Berkeley(加州大学伯克利分校) ; University of Cambridge(剑桥大学) ; University of Washington(华盛顿大学) ; University of Toronto(多伦多大学) ; University of Tokyo(东京大学)
专题命中 规划推理 :reasoning(title,abstract);chain-of-thought(abstract);分类 cs.CL、cs.AI
AI总结 本文通过控制合成环境中的预训练实验,发现语言模型隐式推理所需的最小参数预算与图搜索熵之间存在缩放定律,并确定了每参数最多可处理约0.008比特信息的容量上限。
Comments Accepted to ICML 2026
能否用Vibe编码击败研究生计算机科学学生?一个LLM与人类编码竞赛在市场驱动的战略规划中的表现
机构 * University of Southampton(苏塞克斯大学) ; University of Oxford and Alan Turing Institute(牛津大学和艾伦·图灵研究所)
专题命中 规划推理 :planning(title,abstract);reasoning(abstract);分类 cs.AI、cs.LG
AI总结 本文提出一个基于现实物流优化问题(拍卖、取件和送货问题)的多智能体推理驱动基准,该问题结合了竞争拍卖与容量受限路由。研究通过比较40个LLM编码代理与17个人类编码代理在12场双打全部比赛和约4万场比赛中的表现,揭示了人类编码代理在战略规划和优化任务中的优势,以及LLM在现实世界中生成有效代码的能力不足。
ChatSOP: 一种SOP引导的MCTS规划框架,用于可控的LLM对话代理
机构 * TJUNLP Lab, College of Intelligence and Computing, Tianjin University(天津大学智能计算学院TJUNLP实验室) ; Ping An Technology(平安科技) ; Tübingen AI Center, University of Tübingen(图宾根大学图宾根人工智能中心) ; Kunming University of Science and Technology(昆明理工大学)
专题命中 规划推理 :planning(title,abstract);reasoning(abstract);分类 cs.CL、cs.AI
AI总结 提出ChatSOP框架,通过SOP引导的蒙特卡洛树搜索增强LLM对话代理的可控性,在动作准确率上相比GPT-3.5基线提升27.95%。
Comments Accepted to ACL 2025 main
Journal ref Proceedings of the 63rd Annual Meeting of the Association for Computational Linguistics (Volume 1: Long Papers), pages 17637-17659, 2025
RLVR 无需无效样本:面向 LLM 推理的群体优先级离策略优化
机构 * Department of Automation, Tsinghua University(清华大学自动化系)
专题命中 规划推理 :reasoning(title,abstract);planning(abstract);分类 cs.AI、cs.LG
AI总结 针对强化学习中无效样本导致学习信号不足的问题,提出群体优先级离策略优化(POPO),通过优先级群体重放和解耦重要性采样,在不增加额外采样开销的情况下提升推理性能。
AblationBench:评估实证AI研究中消融实验的自动规划
机构 * Google Research(谷歌研究)
专题命中 规划推理 :planning(title,abstract);chain-of-thought(abstract);分类 cs.CL、cs.AI
AI总结 提出AblationBench基准套件,包含作者消融和审稿人消融两个任务,用于评估语言模型在AI研究中规划消融实验的能力,实验表明当前最佳模型仅能识别45%的原始消融,低于人类水平。
Comments AI4Science Workshop, ICML 2026; Project page: https://ablation-bench.github.io/