PlanPO: Group Planning-Aware Policy Optimization for Multi-Turn Agentic LLMs
PlanPO:面向多轮智能体大语言模型的组规划感知策略优化
专题命中 规划推理 :planning(title,abstract);分类 cs.AI
AI总结 针对现有组相对策略优化无法区分成功轨迹效率差异的问题,提出 PlanPO 方法,引入由粗到细的优势信号,在三类多轮基准上较 GRPO 平均提升 27.2%,且训练成本可忽略。
AI 大模型
大模型数学、逻辑、规划、多步推理和测试时计算能力。
PlanPO:面向多轮智能体大语言模型的组规划感知策略优化
专题命中 规划推理 :planning(title,abstract);分类 cs.AI
AI总结 针对现有组相对策略优化无法区分成功轨迹效率差异的问题,提出 PlanPO 方法,引入由粗到细的优势信号,在三类多轮基准上较 GRPO 平均提升 27.2%,且训练成本可忽略。
基于区域级组织推理与非平衡最优传输的淋巴细胞模拟修正
机构 * Duke University(杜克大学)
专题命中 规划推理 :reasoning(title,abstract);分类 cs.LG
AI总结 针对细胞模拟导致的病理细胞分类歧义问题,提出Loki-OT方法,结合区域级组织推理与非平衡最优传输,在TCGA-BRCA队列上取得更优性能。
Comments 13 pages, 3 figures. Accepted to the MICCAI 2026 COMPAYL Workshop
VISOR: 通过迭代搜索和超视距推理实现基于视觉检索的增强生成
机构 * Soochow University(苏州大学) ; Baidu Inc.(百度公司)
专题命中 规划推理 :reasoning(title,abstract);分类 cs.AI
AI总结 VISOR通过结构化证据空间和动态轨迹机制解决多步推理中的视觉证据稀疏和搜索漂移问题,实现高效长视距视觉推理。
Comments Accepted by ACM Multimedia 2026 (MM '26). 8 pages, 3 figures. Code: https://github.com/syc1336/VISOR
层次间推理:通过层选择性融合恢复视频-语言模型中的时间推理
机构 * National University of Singapore(新加坡国立大学) ; MBZUAI(穆罕默德·本·扎耶德人工智能大学)
专题命中 规划推理 :reasoning(title,abstract);分类 cs.CL
AI总结 本文提出MERIT框架,通过层选择性融合提升视频-语言模型的时间推理能力,同时保持时间感知能力,优于全模型融合和随机层选择。
SemPlan:面向企业数据的基于大语言模型(LLM)查询的结构化语义规划基准测试
机构 * Universidade Federal de Ouro Preto (UFOP)(欧鲁普雷图联邦大学(UFOP))
专题命中 规划推理 :planning(title,abstract);分类 cs.AI
AI总结 该研究构建了SemPlan基准测试,对比四种架构在企业数据LLM查询语义规划中的表现,发现结构化语义规划架构(A3)正确率最高,不同架构在正确率、策略合规性、成本等方面存在权衡。
Comments 11 pages, 3 figures, 9 tables. Submitted to Transactions on Machine Learning Research (TMLR)
基于期望自由能的火星探测机器人信息路径规划
机构 * TU Eindhoven(埃因霍温理工大学) ; Cajal Centre for Neuroscience, Spanish National Research Council(西班牙国家研究委员会卡哈尔神经科学中心)
专题命中 规划推理 :planning(title,abstract);分类 cs.LG
AI总结 该研究提出将主动推理的期望自由能作为统一准则,用于预算约束下的机器人信息路径规划,其规划方法在火星探测场景中可同时实现精准地图构建与高价值区域定位,性能优于信息论基准方法。
Comments accepted for IWAI 2026
SynAct:用于自适应综合优化的推理-行动大语言模型智能体
机构 * The Chinese University of Hong Kong(香港中文大学)
专题命中 规划推理 :reasoning(title,abstract);分类 cs.AI
AI总结 SynAct是一种自适应闭环LLM推理-行动智能体,通过结合电路状态、工具知识与历史经验发布针对性命令,在14个商用设计实验中将平均WNS降至引导式综合的27%,实现高效自适应逻辑综合优化。
Comments 12 pages, 8 figures
LLM-Advisor: 一种用于多地形高效路径规划的LLM基准
机构 * Graduate School of Information Science and Technology, Hokkaido University(弘前大学信息科学与技术研究生院) ; Department of Information and Communication Engineering, The University of Tokyo(东京大学信息与通信工程系)
专题命中 规划推理 :planning(title,abstract);分类 cs.AI
AI总结 LLM-Advisor利用大型语言模型优化多地形路径规划,提升路径成本效率,适用于现实场景。
Comments This paper has been accepted by IEEE Transactions on Automation Science and Engineering
立场:我们需要实用的AI对齐方法来镜像人类推理
专题命中 规划推理 :reasoning(title,abstract);分类 cs.AI
AI总结 该论文提出需实用AI对齐方法镜像人类推理,指出认知对齐可提升AI可理解性与可信赖度,提出研究议程以缩小现有对齐方法与认知对齐需求的差距,助力用户信赖AI系统。
Comments Accepted in ICML 2026
HUGIN:增强自主物流分拣的视觉-语言规划能力
专题命中 规划推理 :planning(title,abstract);分类 cs.AI
AI总结 针对自主物流分拣的联合多场景理解挑战,提出HUGIN训练框架,构建SortingBench基准,在多VLMs上性能提升,验证了方法有效性与实际可行性。
个性化作为逆向规划:通过结构去噪学习智能幻灯片生成的潜在设计意图
机构 * Purdue University(普渡大学) ; Rutgers University(罗格斯大学) ; University at Albany(奥尔巴尼大学) ; Microsoft(微软)
专题命中 规划推理 :planning(title,abstract);分类 cs.AI
AI总结 提出SPIRE框架,将页面级幻灯片个性化视为逆向规划问题,通过结构去噪和强化学习协作学习潜在设计意图,无需预设模板或用户详细指令。
Comments ECCV 2026
时间拉直用于隐式规划
机构 * New York University(纽约大学) ; Brown University(布朗大学) ; University of Toronto(多伦多大学)
专题命中 规划推理 :planning(title,abstract);分类 cs.LG
AI总结 受人类视觉处理中感知拉直假说启发,提出时间拉直方法,通过曲率正则化联合学习JEPA世界模型的编码器和预测器,改善隐式规划中的表示学习,使梯度规划更稳定并提高目标到达任务成功率。
Comments ICML2026 Camera Ready
用于物理一致性开放世界运动规划的能量结构化潜在世界模型与神经时间场
专题命中 规划推理 :planning(title,abstract);分类 cs.AI
AI总结 针对开放世界运动规划的物理一致性挑战,提出能量结构化潜在世界模型ELWM,结合物理条件神经时间场PC-NTF,显著提升了运动预测精度与导航成功率,降低了碰撞率与残差。
Comments 9 pages, 5 figures
STAIR:使用端到端智能体规划框架的有效事件响应
机构 * Peking University(北京大学) ; Southeast University(东南大学) ; Huawei Technologies Co., Ltd.(华为技术有限公司)
专题命中 规划推理 :planning(title,abstract);分类 cs.AI
AI总结 针对事件响应规划的静态工作流和现有LLM智能体的不足,提出端到端智能体规划框架STAIR,在100个Docker网络靶场中实现0.94标准化防御得分,较最强基线提升9.5%。
Comments 12 pages, 5 figures
Branch2Skill:基于推理树的高效技能演化方法
专题命中 规划推理 :reasoning(title,abstract);分类 cs.AI
AI总结 Branch2Skill是将推理树转化为密集监督信号的框架,通过蒙特卡洛树搜索提取推理证据并提炼更新,在六个基准测试中提升了任务性能与技能演化效率,以GPT 5.5为目标模型时token用量比SkillOpt少73.2%
Comments 9 pages, 6 figures, 3 tables. Technical report
用质量多样性优化发现多模态具身智能体的多样化规划策略
机构 * School of Artificial Intelligence, Nanjing University of Information Science and Technology(南京信息工程大学人工智能学院)
专题命中 规划推理 :planning(title,abstract);分类 cs.AI
AI总结 针对多模态具身智能体现有规划器易因单一规划风格失效导致停滞的问题,提出质量多样性框架,通过进化策略模板构建多样化策略库,实现自适应规划与故障恢复,在ThreeDWorld基准上提升了任务成功率与交互效率。
Comments To appear in ACM MM (MM '26)
基于证据的取证推理:检测与定位多模态媒体篡改
专题命中 规划推理 :reasoning(title,abstract);分类 cs.AI
AI总结 本文针对多模态媒体篡改检测与定位问题,提出基于证据的取证推理框架,结合锚定-验证推理链、可验证奖励系统与模态解耦优势路由机制,实现最优性能与可解释性的统一。
Comments accepted by ACM MM 2026
SCOUT:面向超长时长自我中心视频推理的自检查与恢复感知工具思维智能体
机构 * Sun Yat-sen University(中山大学) ; Shenzhen Loop Area Institute(深圳河套学院) ; Guangdong OPPO Mobile Telecommunications Corp., Ltd.(广东欧珀移动通信有限公司) ; OPPO AI Center(OPPO人工智能中心) ; The Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳))
专题命中 规划推理 :reasoning(title,abstract);分类 cs.AI
AI总结 本研究提出SCOUT智能体框架,结合自适应策略与UPS-GRPO方法,解决超长自我中心视频推理的错误传播及信用分配问题,在对应基准上达最优性能且短时长场景仍具竞争力。
Comments Accepted by ACM Multimedia 2026 (MM '26)
GraphThink:用于长视距具身任务规划的图增强大语言模型思维
机构 * Gaoling School of Artificial Intelligence, Renmin University of China(中国人民大学高瓴人工智能学院) ; Beijing Academy of Artificial Intelligence(北京人工智能研究院) ; Tsinghua University(清华大学) ; The Hong Kong Polytechnic University(香港理工大学)
专题命中 规划推理 :planning(title,abstract);分类 cs.AI
AI总结 GraphThink框架结合任务图与场景图,通过上下文提示、迭代优化、GRPO奖励设计及事件驱动重规划,在ALFRED基准上实现最优性能,具强泛化能力。
当评判者不应做决定时:证据锁定的非补偿选择界限在推理流程中限制大语言模型评判者的失效
机构 * School of Computing and Information Technology, University of Wollongong(伍伦贡大学计算与信息技术学院) ; CSIRO’s Data61(联邦科学与工业研究组织Data61研究院) ; School of Computer Science and Information Technology, Adelaide University(阿德莱德大学计算机科学与信息技术学院)
专题命中 规划推理 :reasoning(title,abstract);分类 cs.AI
AI总结 该研究针对推理流程中的LLM评判者,提出证据锁定的非补偿规则EL-DGR,在不改变评判者等条件下提升了GSM8K和HotpotQA任务性能,发现应限制评判者影响范围而非提升其准确率。
NormAct:具身规划中隐藏社会规范遵守的基准
机构 * State Key Laboratory of General Artificial Intelligence, Beijing Institute for General Artificial Intelligence (BIGAI)(通用人工智能国家重点实验室,北京通用人工智能研究院) ; China Academy of Information and Communications Technology(中国信息通信研究院) ; ShanghaiTech University(上海科技大学)
专题命中 规划推理 :planning(title,abstract);分类 cs.AI
AI总结 提出NormAct基准,评估多模态大语言模型在具身规划中遵守隐藏社会规范的能力,发现模型在67.3%情况下达成显式目标,但仅26.4%遵守隐藏规范;提出NormPerceptor方法将任务成功率从24.2%提升至46.7%。
Comments This version revises the paper content and adds substantial details on the benchmark design and experimental setup
超越《星夜》:面向艺术家基础的文本到图像生成的捷径感知控制状态规划
机构 * Jilin University(吉林大学) ; Adobe(奥多比公司) ; University of Wisconsin(威斯康星大学)
专题命中 规划推理 :planning(title,abstract);分类 cs.AI
AI总结 该研究针对艺术家基础的文本到图像生成存在的捷径偏差问题,提出 Atelier 框架,结合 ArtIntentBench 基准测试,提升了风格保真度与结构保留度,减少了捷径替换。
Comments 47 pages, 13 figures, including appendices. Kuan Xing and Ye Wang contributed equally
求解器引导的混合策略均衡推理
机构 * Shanghai Jiao Tong University(上海交通大学) ; GTO Wizard ; Tsinghua University(清华大学) ; The Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳)) ; Vector Institute(向量研究所)
专题命中 规划推理 :reasoning(title,abstract);分类 cs.LG
AI总结 本研究提出混合策略决策树(MDT),用求解器输出引导LLM在博弈中的均衡推理,在无限制德州扑克8种LLM配置下,将与均衡的L1距离降低52.6%,且策略可移植性良好。
优化器即智能体:跨提示、程序与机器学习工作流的推理驱动搜索
机构 * The University of Texas at Austin(德克萨斯大学奥斯汀分校) ; Snowflake(思诺飞克公司)
专题命中 规划推理 :reasoning(title,abstract);分类 cs.AI
AI总结 该研究提出ReASearch统一框架,让智能体自主优化提示、程序与ML工作流,在14项任务中优于专用系统,部分发现超人类最佳结果的方案。
Journal ref COLM 2026
KNOWPLAN:用于智能学位路径规划的知识驱动型AI智能体
专题命中 规划推理 :planning(title,abstract);分类 cs.AI
AI总结 KnowPlan将学位路径规划拆分为提取与优化阶段,CatalogBrowse负责课程爬取解析,DegreeMap基于超图优化,在多赛道实验中实现了高召回率、可行性与效用提升。
机构 * Bosch Center for Artificial Intelligence(博世人工智能中心) ; Karlsruhe Institute of Technology(卡尔斯鲁厄理工学院)
专题命中 规划推理 :planning(title,abstract);分类 cs.AI
Comments Accepted at IEEE CASE 2025, 8 pages, 8 figures
Journal ref 2025 IEEE 21st International Conference on Automation Science and Engineering (CASE), 2025, pp. 1701-1708
利用层级推理和话语级目标奖励增强大型语言模型的社交智能
机构 * Alibaba Group(阿里巴巴集团) ; Shanghai Jiao Tong University(上海交通大学)
专题命中 规划推理 :reasoning(title);planning(abstract);分类 cs.CL
AI总结 该研究针对LLMs社交互动不足的问题,提出TSR框架与LHRL-VGR算法,微调Qwen2.5-7B智能体后在SOTOPIA基准上超过GPT-4o基线7.32%,实现多智能体社交谈判的最优性能。
如您所愿:利用LLM在精准农业中进行形式化验证的任务规划
机构 * University of California, Merced(加州大学默塞德分校)
专题命中 规划推理 :planning(title,abstract);分类 cs.AI
AI总结 针对自然语言歧义性,提出基于线性时序逻辑(LTL)反馈循环的LLM任务规划系统,通过双LLM分工实现规范生成与验证,提升精准农业任务规划的可靠性。
Journal ref Published in Proceedings of 2026 International Conference on Robotics and Automation (ICRA)
RICE-PO:将检索交互转化为推理智能体的信用信号
机构 * University of Massachusetts, Amherst(马萨诸塞大学阿姆赫斯特分校) ; Texas Tech University(得克萨斯科技大学) ; University of Connecticut(康涅狄格大学)
专题命中 规划推理 :reasoning(title,abstract);分类 cs.CL
AI总结 提出RICE-PO框架,通过将检索交互转化为局部学习信号,解决推理型检索智能体在训练中推理步骤的信用分配问题,在BRIGHT和BEIR上优于基线。
CoPlan:一种基于角色可争议论证图的可信协同智能照护规划界面
机构 * University of New Brunswick(新不伦瑞克大学) ; National Research Council Canada(加拿大国家研究委员会) ; Thompson Rivers University(汤普森河大学) ; ISB Corporation(ISB公司) ; University of Northern British Columbia(北英属哥伦比亚大学)
专题命中 规划推理 :planning(title,abstract);分类 cs.AI
AI总结 本研究提出CoPlan界面,通过多智能体工作流结合协同智能与可争议性,实现人机协同照护规划,保留人类自主性与临床问责制,已在就地养老场景中验证其有效性。
Comments Accepted at the 2026 International Conference on Next Generation AI Systems (NGEN-AI 2026)