The AI in the Mirror: LLM Self-Recognition in an Iterated Public Goods Game
机构 * Columbia University(哥伦比亚大学) ; Mila, Polytechnique Montréal(蒙特利尔大学Mila)
专题命中 规划决策 :agent(abstract);AI agent(abstract);tool use(abstract);multi-agent(abstract)
AI 大模型
智能体、工具调用、规划、工作流、多智能体和自主任务执行。
机构 * Columbia University(哥伦比亚大学) ; Mila, Polytechnique Montréal(蒙特利尔大学Mila)
专题命中 规划决策 :agent(abstract);AI agent(abstract);tool use(abstract);multi-agent(abstract)
机构 * School of Informatics, University of Edinburgh(信息学院,爱丁堡大学) ; Microsoft(微软公司)
专题命中 规划决策 :agent(abstract);autonomous agent(abstract);workflow(abstract);multi-agent(abstract)
专题命中 规划决策 :agent(abstract);AI agent(abstract);planning(abstract);multi-agent(abstract)
专题命中 规划决策 :planning(title,abstract);分类 cs.AI
Comments 5 pages, International Workshop of Hierarchical Planning (ICAPS), 2023
Journal ref International Workshop of Hierarchical Planning (ICAPS), 2023
专题命中 规划决策 :agent(abstract);autonomous agent(abstract);planning(abstract);multi-agent(abstract)
专题命中 规划决策 :planning(title,abstract);分类 cs.AI;agent(comments);multi-agent(comments)
Comments Accepted for presentation in (and publication in the proceedings of) The IEEE 2019 International Symposium on Multi-Robot and Multi-Agent Systems (MRS)
顺序因果正常形式游戏:理论、计算与战略信号
专题命中 规划决策 :agentic(abstract,comments);agent(abstract);AI agent(abstract);multi-agent(abstract)
AI总结 本文探讨了经典博弈论框架能否扩展以捕捉AI代理的有限理性与因果推理,通过引入顺序因果多智能体系统(S-CMAS),发现其在所有测试场景中无法提供福利改进,揭示了理性选择与因果推理的不兼容性。
Comments AAAI 2026 Workshop on Foundations of Agentic Systems Theory
专题命中 规划决策 :planning(title,abstract);agent(comments);multi-agent(comments)
Comments Key Words: Dynamic Game Theory, Multi-Agent Motion Planning
RePolicy:用于智能体安全保障中安全策略调用的强化学习方法
机构 * Zhejiang University(浙江大学) ; Zhongguancun Academy(中关村学院) ; University of Science and Technology of China(中国科学技术大学) ; National University of Singapore(新加坡国立大学)
专题命中 规划决策 :agent(title,abstract);分类 cs.AI、cs.CL
AI总结 针对现有智能体安全保障方法难以适应未见轨迹和变化策略上下文的问题,提出RePolicy方法,结合PolicyTraj-20K与带可验证奖励和策略上下文扰动的GRPO,在六个智能体安全基准上取得良好安全检测与策略调用效果。
DeepPlanner:通过优势塑造提升深度研究智能体的规划能力
机构 * The Hong Kong University of Science and Technology(香港科技大学) ; Amazon(亚马逊) ; University of California, San Diego(加州大学圣地亚哥分校)
专题命中 规划决策 :planning(title,abstract);分类 cs.AI、cs.CL
AI总结 针对现有深度研究智能体规划阶段优化不足的问题,提出端到端 RL 框架 DeepPlanner,通过塑造 token 级优势与选择性提升样本级优势,在7个基准上以更低训练预算实现最优规划效果。
Comments Accepted by ACL 2026
学习共享与个性化内容:面向智能体记忆的分层策略协同进化
机构 * University of Science and Technology of China(中国科学技术大学) ; State Key Laboratory of Cognitive Intelligence(认知智能国家重点实验室)
专题命中 规划决策 :agent(title,abstract);分类 cs.AI、cs.CL
AI总结 本研究提出HiPS框架,将智能体记忆管理解耦为全局共享基础与用户特定自适应层,通过协同进化优化策略,使记忆增强智能体的响应性能持续优于基线方法。
Comments EMNLP'2026 Main Conference
用于离线轨迹规划的贝叶斯流网络
机构 * Norwegian University of Science and Technology(挪威科技大学)
专题命中 规划决策 :planning(title,abstract);分类 cs.AI、cs.LG
AI总结 该研究提出基于贝叶斯流网络(BFNs)的BFN-RL框架,可在单一概率公式内建模离散与连续轨迹空间,经实验验证其能在两类状态空间生成有效轨迹,为离线轨迹规划提供通用生成基础。
智能体安全:LLM驱动渗透测试的工具、失效模式与设计法则体系化研究
机构 * Ahsanullah University of Science and Technology(阿赫桑乌拉科技大学) ; BRAC University(BRAC大学) ; North South University(北南大学) ; Missouri State University(密苏里州立大学) ; Multimedia University(多媒体大学) ; American International University-Bangladesh(孟加拉国美国国际大学)
专题命中 规划决策 :agentic(title,abstract);分类 cs.AI、cs.CL
AI总结 该研究对LLM驱动渗透测试的智能体安全相关工具、失效模式等体系化,推导定量规律与设计法则,实现Inspectra平台验证。
DeepRefine: 通过强化学习进行代理编译知识的精炼
机构 * HKUST(香港科技大学) ; HKBU(香港大学) ; Microsoft Research Asia Hong Kong(微软亚洲研究院(香港))
专题命中 规划决策 :agentic(title,abstract);分类 cs.AI、cs.CL
AI总结 DeepRefine是一种基于LLM的推理模型,通过用户查询提升预构建知识库的质量,以适应下游任务。该模型通过多轮交互和归纳诊断定位缺陷并进行针对性精炼,采用Gain-Beyond-Draft奖励机制进行强化学习训练。
LongRCA Bench:诊断长 horizon 智能体失败中的责任角色与根本原因
机构 * Computer Network Information Center, Chinese Academy of Sciences(中国科学院计算机网络信息中心) ; Hangzhou Institute for Advanced Study, University of Chinese Academy of Sciences(中国科学院大学杭州高等研究院) ; Chongqing University(重庆大学) ; Institute of Computing Technology, Chinese Academy of Sciences(中国科学院计算技术研究所) ; Singapore Management University(新加坡管理大学) ; Tongyi Lab, Alibaba Group(阿里巴巴集团通义实验室) ; Tsinghua University(清华大学)
专题命中 规划决策 :agent(title,abstract);分类 cs.AI、cs.SE
AI总结 LongRCA Bench 是含1140条失败轨迹的长 horizon 智能体失败诊断基准,本文提出无需训练的 RCTA 方法,在责任角色归因和根本步骤定位上优于现有基线,表明需将二者作为独立评估目标。
Comments 18 pages, 6 figures. Yunfei Zhang and Boyu Feng contributed equally. Changhua Pei is the corresponding author
代理检索增强推理重塑放射学问答中的集体可靠性在模型变异性下
专题命中 规划决策 :agentic(title,abstract);分类 cs.AI、cs.LG
AI总结 代理检索增强推理在放射学问答中提升了集体可靠性,通过减少模型决策分散和增强跨模型正确性鲁棒性,但高一致性不保证正确性。
Journal ref Patterns, 101639, 2026
通过数据合成与统一规划扩展基于手册的家电操作规模
机构 * Center on Frontiers of Computing Studies, School of Computer Science, Peking University(北京大学计算机学院计算前沿研究中心) ; Beijing University of Aeronautics and Astronautics(北京航空航天大学) ; Jingdong Technology Information Technology Co., Ltd(京东科技信息技术有限公司)
专题命中 规划决策 :planning(title,abstract);分类 cs.AI、cs.CL
AI总结 针对现有大模型缺乏支持基于手册的家电操作规划的数据集的问题,提出MAGE数据合成流水线构建UseAppliance数据集,开发AppliancePlan模型,在RealAppliance-Bench和真实机器人实验中表现优异,推进通用家用机器人发展。
Comments Accepted by ACM MM 26
信任并不足够:智能体强化学习中策略内自蒸馏的影响校准
专题命中 规划决策 :agentic(title,abstract);分类 cs.AI、cs.CL
AI总结 针对策略内自蒸馏的信任-效用不匹配问题,提出ICSD方法,在多基准任务上提升语言智能体性能,降低反向令牌的教师支持占比并提高梯度兼容性。
Intern-S2-Preview:科学智能体基础模型
机构 * Shanghai AI Laboratory(上海人工智能实验室)
专题命中 规划决策 :agentic(title,abstract);分类 cs.CL、cs.LG
AI总结 本研究提出Intern-S2-Preview系列科学智能体基础模型,通过多阶段训练与架构优化,在多类基准上取得领先结果,相关模块可提升科学任务表现且无需修改主干模型。
Comments 35 pages, 12 figures
超越检索:基于查询条件的长程智能体轨迹复用
专题命中 规划决策 :agent(title,abstract);分类 cs.AI、cs.CL
AI总结 该研究针对长程智能体轨迹检索后复用的瓶颈,构建评估框架并提出QCR方法,在多任务基准上验证其优于直接轨迹复用,实现检索质量与经验转化的分离。
基于学习的自动驾驶行为规划:现实世界集成与部署
机构 * RWTH Aachen University(亚琛工业大学) ; Technical University of Munich(慕尼黑工业大学)
专题命中 规划决策 :planning(title,abstract);分类 cs.AI、cs.LG
AI总结 本文提出结合机器学习与经典方法的混合规划架构,通过深度神经网络解读交通场景、优化监督层验证约束,经实车部署验证其在自动驾驶行为规划中的有效性。
Comments 17 pages; Accepted to be published as part of the 17. Uni-DAS e.V. Workshop "Fahrerassistenz und automatisiertes Fahren", September 29-30, 2026
从环境反馈中学习:面向智能体强化学习的跨时间尺度信用分配
专题命中 规划决策 :agentic(title,abstract);分类 cs.CL、cs.LG
AI总结 针对智能体强化学习的奖励延迟稀疏问题,提出基于环境反馈的跨时间尺度信用分配方法EFCA,在ALFWorld和WebShop上提升了任务成功率与质量。
SAKE:通过强化学习进行复杂LLM推理的结构代理知识外推
机构 * University of Pennsylvania(宾夕法尼亚大学) ; University of California, Berkeley(加州大学伯克利分校)
专题命中 规划决策 :agentic(title,abstract);分类 cs.AI、cs.CL
AI总结 SAKE通过强化学习训练LLM自主检索和外推结构化知识,提升生物医学和常识领域推理性能,同时减少90%以上token使用。
无评价深度强化学习用于不规则六边形网格上的海上覆盖路径规划
专题命中 规划决策 :planning(title,abstract);分类 cs.AI、cs.LG
AI总结 本文提出一种深度强化学习框架,用于在不规则海域的六边形网格上解决覆盖路径规划问题,通过Transformer指针策略自回归构造覆盖路径,并采用无评价组相对策略优化方法,实现高效路径规划。
基于VLM标注数据集训练条件化电子游戏智能体
专题命中 规划决策 :agent(title,abstract);分类 cs.AI、cs.LG
AI总结 该研究针对电子游戏强化学习中奖励获取、加权及稀疏性等问题,提出用VLM标注数据集,结合离线RL训练条件化智能体,并分析实验中的困难与局限。
显式规划与反应分解的轨迹预测统一框架
机构 * Software College, Northeastern University(东北大学软件学院)
专题命中 规划决策 :planning(title,abstract);分类 cs.AI、cs.LG
AI总结 针对现有轨迹预测方法未充分区分社会影响功能角色的问题,提出INTraJ框架,将社会影响分解为规划与反应两阶段,在四个基准上实现性能提升,验证了阶段性社会建模的重要性。
Comments Accepted by ACM MM 2026
蒸馏前先前瞻:智能体策略内蒸馏中教师指导的未来轨迹验证
机构 * Meituan LongCat Interaction(美团龙猫交互) ; Shanghai Jiao Tong University(上海交通大学) ; Fudan University(复旦大学) ; Peking University(北京大学) ; Nanjing University(南京大学) ; University of Chinese Academy of Sciences(中国科学院大学) ; Jilin University(吉林大学) ; University of Science and Technology of China(中国科学技术大学) ; The Hong Kong Polytechnic University(香港理工大学)
专题命中 规划决策 :agentic(title,abstract);分类 cs.CL、cs.LG
AI总结 该研究针对策略内蒸馏的学生轨迹偏差问题,提出FutureBridge-OPD方法,在多任务基准上显著优于现有方法,代码公开可用。
Comments 15 pages, 5 figures
ACE-GraphRAG:面向分层GraphRAG的智能体上下文工程
机构 * The Chinese University of Hong Kong(香港中文大学) ; Wuhan University of Technology(武汉理工大学) ; The Hong Kong University of Science and Technology(香港科技大学) ; Huawei Noah’s Ark Lab(华为诺亚方舟实验室)
专题命中 规划决策 :agentic(title,abstract);分类 cs.AI、cs.CL
AI总结 ACE-GraphRAG针对分层GraphRAG的表示-推理差距,提出两种自适应上下文策略,在多任务基准上优于现有RAG和GraphRAG基线,验证了动态上下文构建策略的有效性。
Comments Withdrawn because the manuscript was posted prematurely before completion of the required internal review and release authorization
基于矩闭合的不确定性下解析规划
机构 * McGill University(麦吉尔大学) ; Mila – Quebec Artificial Intelligence Institute(米拉-魁北克人工智能研究所)
专题命中 规划决策 :planning(title,abstract);分类 cs.AI、cs.LG
AI总结 本文提出一种基于矩闭合的不确定性下解析规划方法,通过二次动作值参数化实现闭式贝尔曼备份,在连续控制中降低目标方差,为感知分布的规划提供了合理框架。
Comments To appear in Proceedings of the 42nd Conference on Uncertainty in Artificial Intelligence (UAI 2026), PMLR
面向智能体强化学习的组内自蒸馏方法
机构 * Baidu(百度)
专题命中 规划决策 :agentic(title,abstract);分类 cs.AI、cs.LG
AI总结 该研究针对智能体强化学习中终端奖励监督粗粒度的问题,提出组内自蒸馏方法,利用策略自身已验证轨迹生成指导,细化回合级信用分配,在多环境多模型上性能优于基线且泛化性更好。