Planning With Discrete Harmonic Potential Fields
专题命中 规划决策 :planning(title,abstract)
Journal ref "Mobile Robots Motion Planning: New Challanges", I-TECH, Vienna, Austeria, 2008, Pp. 335-360
AI 大模型
智能体、工具调用、规划、工作流、多智能体和自主任务执行。
专题命中 规划决策 :planning(title,abstract)
Journal ref "Mobile Robots Motion Planning: New Challanges", I-TECH, Vienna, Austeria, 2008, Pp. 335-360
专题命中 规划决策 :planning(title,abstract)
Journal ref Strobel, Volker, and Alexandra Kirsch. "Planning in the Wild: Modeling Tools for PDDL." KI 2014: Advances in Artificial Intelligence. Springer International Publishing, 2014. 273-284
专题命中 规划决策 :planning(title,abstract)
Comments ICRA'15, Workshop on Optimal Robot Motion Planning, full paper. Draft for IJRR submission
专题命中 规划决策 :planning(title,abstract)
Journal ref Journal of Planning Education and Research, vol. 32, no. 2, June 2012, 169-181
专题命中 规划决策 :planning(title,abstract)
Comments Flyvbjerg, Bent, 2013, "How Planners Deal with Uncomfortable Knowledge: The Dubious Ethics of the American Planning Association," Cities
隐式在线策略自蒸馏
机构 * Shanghai Jiao Tong University(上海交通大学) ; National University of Singapore(新加坡国立大学)
专题命中 规划决策 :agent(abstract);tool use(abstract);agentic(abstract);分类 cs.CL、cs.LG
AI总结 本研究提出隐式在线策略自蒸馏(LOPD),将教师的特权上下文改为端到端可学习,在智能体工具使用和代码生成任务上,以远低于对比方法的rollout预算实现了更优性能。
长视界终端任务的递归合成
机构 * Tencent HY LLM Frontier(腾讯HY大模型前沿团队) ; University of Georgia(佐治亚大学) ; University of Maryland, College Park(马里兰大学帕克分校) ; University of Pennsylvania(宾夕法尼亚大学) ; University of Minnesota, Twin Cities(明尼苏达大学双城分校) ; Indiana University(印第安纳大学) ; National University of Singapore(新加坡国立大学) ; Hong Kong Polytechnic University(香港理工大学)
专题命中 规划决策 :agent(abstract);workflow(abstract);agentic(abstract);分类 cs.AI、cs.LG
AI总结 本文提出RST递归合成框架,低成本规模化生成3.7万余个长视界终端任务,经微调或PPO优化后,多款Qwen模型在多个终端基准任务上性能显著提升,且递归过程无明显上限。
LoongReflect:通过全局视角蒸馏提升搜索智能体的长程反思能力
专题命中 规划决策 :agent(abstract);tool use(abstract);planning(abstract);分类 cs.AI、cs.LG
AI总结 LoongReflect是将反思表述为记忆控制策略的训练框架,通过双信号通道结合全局视角蒸馏与结果导向GRPO优化,在多跳检索增强生成和数学推理任务上提升了搜索智能体的长程反思能力。
Comments 15 pages, 8 figures
DSAgentBench:智能体能否在真实计算机环境中自动化端到端数据科学工作流?
机构 * York University(约克大学) ; Nanyang Technological University(南洋理工大学) ; Salesforce AI Research(Salesforce AI研究院)
专题命中 规划决策 :agent(abstract);tool use(abstract);agentic(abstract);分类 cs.AI、cs.CL
AI总结 DSAgentBench是首个评估智能体在真实计算机环境中自动化完整数据科学工作流的基准,含275项任务,实验显示现有智能体与实际需求存在显著能力差距。
SciDataSailor:深度科学数据探索
专题命中 规划决策 :tool use(abstract);planning(abstract);agentic(abstract);分类 cs.AI、cs.CL
AI总结 该研究针对科学数据仓库交互难题,提出SciDataSailor框架,以带特定机制的MCTS实现轨迹合成,构建了微调模型与含千余任务的评估基准,推动LLM智能体的科学数据探索能力。
Comments 63 pages, 10 figures
计划以神秘的方式起作用:评估电子表格代理的计划模式
专题命中 规划决策 :agent(abstract);planning(abstract);agentic(abstract);分类 cs.AI、cs.SE
AI总结 研究电子表格代理计划模式,构建原型并通过用户研究与非计划基线评估,发现虽任务结果相似,但计划模式可减少优化,提升用户对工具在创造力支持和人机协作方面的感知,探讨了对计划模式设计及人机规划的影响。
Comments Accepted at IEEE VL/HCC 2026
野外的智能体:研究与部署的交汇点
机构 * Georgetown University(乔治敦大学) ; Salesforce(Salesforce公司) ; Bayer(拜耳公司) ; Bloomberg(彭博公司) ; Microsoft Research(微软研究院)
专题命中 规划决策 :agent(abstract);planning(abstract);agentic(abstract);分类 cs.AI、cs.CL
AI总结 探讨基于大语言模型的智能体系统从研究到部署的转变,通过案例研究分析成功设计模式及失败缓解策略,为与会者提供跨行业安全可靠部署的全面视角、设计模式、评估清单和模板。
从行为到理解:LLM代理中时间概念的符合可解释性
机构 * Georgia State University(佐治亚州立大学) ; Computer Science Lab, SRI(SRI计算机科学实验室) ; Army Cyber Institute(陆军网络学院) ; United States Military Academy(美国军事学院) ; University of Florida(佛罗里达大学)
专题命中 规划决策 :agent(abstract);autonomous agent(abstract);planning(abstract);分类 cs.AI、cs.CL
AI总结 本文提出通过符合视角解释LLM代理时间概念演变的框架,结合逐步奖励建模与符合预测,识别时间概念的潜在方向,实验表明这些概念可线性分离,为LLM代理提供可靠故障检测和干预方法。
Comments Accepted at the Mechanistic Interpretability Workshop, 43rd International Conference on Machine Learning, Seoul, South Korea, 2026
HAAS Studio: 用于模拟、基准测试和管理人-AI工作分配的工具
机构 * Valencian Research Institute for Artificial Intelligence(巴伦西亚人工智能研究 institute)
专题命中 规划决策 :planning(abstract,abstract_cn);workflow(abstract);分类 cs.AI、cs.SE
AI总结 提出HAAS Studio,一个用于策略感知的自适应人-AI任务分配的模拟与决策支持工具,结合认知表示、协作光谱、多臂老虎机算法和基于契约的治理,支持多领域部署决策。
超越奖励工程:长上下文强化学习的数据配方
机构 * OpenBMB ; Tsinghua University(清华大学)
专题命中 规划决策 :agent(abstract);autonomous agent(abstract);agentic(abstract);分类 cs.AI、cs.CL
AI总结 提出一种简单有效的数据配方,结合最小化基于结果的GRPO设置,显著提升大语言模型的长上下文推理能力,在多个基准和智能体任务上取得平均+3.2至+7.2点的提升。
Comments 15 pages, 6 figures, 12 tables
Open-SWE-Traces:推进软件工程智能体的双模式多语言蒸馏
机构 * NVIDIA(英伟达)
专题命中 规划决策 :agent(abstract,abstract_cn);agentic(abstract);分类 cs.AI、cs.SE
AI总结 为解决软件工程智能体训练数据稀缺问题,构建包含20万条轨迹、覆盖9种编程语言的数据集,采用混合推理合成方法,微调Qwen3-30B-A3B系列模型,在SWE-bench基准上取得领先性能。
Comments Work in progress
注意差距:前沿大语言模型能否通过标准化办公能力考试?
机构 * Microsoft Research(微软研究院)
专题命中 规划决策 :agent(abstract);planning(abstract);agentic(abstract);分类 cs.AI、cs.CL
AI总结 基于中国计算机等级考试(NCRE)的200个综合操作任务,评估7个前沿LLM在Word、Excel和PowerPoint自动化中的表现,发现单轮模型最高得分率36.6%,带执行反馈的智能体系统达68.8%,仍低于95.5%的社区参考分,表明可靠细粒度办公自动化仍是重大挑战。
Comments 21 pages, 5 figures
MLEvolve:一种用于自动化机器学习算法发现的自我进化框架
机构 * Shanghai Artificial Intelligence Laboratory(上海人工智能实验室) ; East China Normal University(东华大学)
专题命中 规划决策 :agent(abstract);planning(abstract);multi-agent(abstract);分类 cs.AI、cs.CL
AI总结 提出MLEvolve框架,通过渐进式MCGS、回溯记忆和分层控制解决LLM智能体在长期任务中的信息隔离、无记忆搜索和缺乏分层控制问题,在MLE-Bench和数学算法优化任务上取得最先进性能。
符号中介作为LLM驱动几何推理的语言-数值接口
机构 * Idiap Research Institute(Idiap研究 institute) ; École Polytechnique Fédérale de Lausanne(瑞士联邦理工学院) ; Honda Research Institute Europe(本田欧洲研究院) ; Department of Computer Science, University of Manchester(曼彻斯特大学计算机科学系) ; National Biomarker Centre, CRUK-MI, University of Manchester(曼彻斯特大学国家生物标记中心)
专题命中 规划决策 :agent(abstract);planning(abstract);agentic(abstract);分类 cs.AI、cs.CL
AI总结 提出符号中介作为连接物理模拟器数值输出与语言模型推理的接口,通过符号回归将连续数值转化为符号表达式,并在协同优化循环中提升几何推理性能。
Comments 33 pages, 18 figures
KYA: 面向自主系统的框架无关信任层,具有可验证溯源和分层策略组合
机构 * Veldt Labs(Veldt实验室)
专题命中 规划决策 :agent(abstract);AI agent(abstract);multi-agent(abstract);分类 cs.AI、cs.SE
AI总结 提出KYA,一个框架无关的信任与治理层,通过五元组原语实现自主系统的授权、策略合规和事后可验证性,在跨后端矩阵上全部通过测试,检测89%的对抗性探测。
Comments 26 pages including appendix. Code available under Apache 2.0 at https://github.com/veldtlabs/veldt-kya (pip install veldt-kya). Two-domain worked examples (loan decisioning under NYDFS/ECOA/CFPB; clinical triage under HIPAA/21 CFR Part 11/FDA SaMD).Reproducibility artifacts in-tree
SciResearcher: 面向前沿科学推理的深度研究智能体规模化
机构 * HKUST(香港科技大学) ; CUHK(香港大学) ; Tencent AI Lab(腾讯AI实验室)
专题命中 规划决策 :agent(abstract);AI agent(abstract);agentic(abstract);分类 cs.AI、cs.CL
AI总结 提出SciResearcher框架,通过合成基于学术证据的概念与计算任务并训练智能体,在HLE-Bio/Chem-Gold等基准上达到最优性能。
Comments 23 pages, 6 figures, 15 tables
为什么我们需要世界模型来实现通用人工智能:大语言模型失败之处以及世界模型如何可能超越
机构 * Department of Computing Technologies(计算技术系) ; SRM Institute of Science and Technology(SRM科学与技术学院) ; Bio-Sensing and Bio-Sensors Group(生物传感与生物传感器组) ; Smart Automation and Communication Technologies Research Institute of Sciences and Engineering(科学与工程智能自动化与通信技术研究所) ; University of Sharjah, UAE(阿联酋沙迦大学) ; Department of Computer Engineering(计算机工程系) ; College of Computing and Informatics(计算与信息学院)
专题命中 规划决策 :agent(abstract,abstract_cn);planning(abstract);分类 cs.AI、cs.CL
AI总结 本文通过提出潜在动态推理(LDI)概念和Flux环境案例研究,论证了大语言模型在因果推理、状态跟踪和长程规划上的局限性,并展示基于显式状态空间的强化学习智能体在长程游戏中显著优于纯文本LLM。
Comments 19 pages, 5 figures
f-OPD: 通过新鲜度感知控制稳定长周期在线策略蒸馏
机构 * The Hong Kong Polytechnic University(香港理工大学)
专题命中 规划决策 :agent(abstract);tool-use(abstract);agentic(abstract);分类 cs.AI、cs.LG
AI总结 本文提出f-OPD框架,通过引入样本级新鲜度评分来稳定长周期在线策略蒸馏,实现性能与效率的平衡,为大规模长周期智能体训练奠定基础。
面向AI功能开发者的IDE工具包
机构 * JetBrains
专题命中 规划决策 :AI agent(abstract);workflow(abstract);agentic(abstract);分类 cs.AI、cs.SE
AI总结 本文提出面向AI功能开发者的IDE工具包,通过集成追踪和评估功能,帮助软件工程师更高效地测试和调试AI功能,降低开发门槛。
Comments Published at IDE'26 co-located with ICSE'26
位置:学术会议可能面临由完全自动化科学代理引发的分母游戏威胁
机构 * Shanghai Jiao Tong University(上海交通大学) ; Central South University(中南大学) ; Carnegie Mellon University(卡内基梅隆大学)
专题命中 规划决策 :agent(abstract);AI agent(abstract);agentic(abstract);分类 cs.AI、cs.CL
AI总结 本文探讨了由完全自动化科学代理引发的分母游戏威胁,分析了其对学术会议评审系统的影响,并提出系统性政策改革作为缓解措施。
Comments Accepted by ICML'26 Position Track
LLM代理预测社交媒体反应但不优于文本分类器:使用120,000多个1511人的人设进行基准测试
机构 * Institute for Artificial Intelligence Research and Development of Serbia(塞尔维亚人工智能研究与开发研究所) ; University of Belgrade, Institute for Philosophy and Social Theory, Digital Society Lab(贝尔格莱德大学,哲学与社会理论研究所,数字社会实验室) ; Complexity Science Hub, Vienna, Austria(维也纳复杂科学中心) ; Graz University of Technology, Graz, Austria(技术大学格拉茨,格拉茨,奥地利) ; University of Novi Sad, Faculty of Philosophy, Novi Sad, Serbia(诺维萨德大学,哲学学院,诺维萨德,塞尔维亚) ; University of Trier, Trier, Germany(特里尔大学,特里尔,德国) ; Vrije University Amsterdam, Amsterdam, Netherlands(阿姆斯特丹自由大学,阿姆斯特丹,荷兰)
专题命中 规划决策 :agent(abstract);AI agent(abstract);agentic(abstract);分类 cs.AI、cs.CL
AI总结 本文研究LLM代理预测人类社交媒体反应的准确性,发现其表现不如传统文本分类器,揭示了零样本代理在模拟极化动态中的潜力及局限性。
PiERN:基于令牌级别的路由以整合高精度计算与推理
机构 * Peking University(北京大学) ; Peking University Changsha Institute for Computing and Digital Economy(北京大学长沙计算与数字经济研究院) ; Beihang University(北京航空航天大学) ; Tsinghua University(清华大学)
专题命中 规划决策 :agent(abstract);tool-use(abstract);multi-agent(abstract);分类 cs.CL、cs.LG
AI总结 PiERN通过内生整合计算能力,提升语言模型在复杂系统中的精度与效率,实现高准确性、低延迟和可扩展性。
CocoaBench:评估真实世界的统一数字代理
机构 * CocoaBench Team(CocoaBench 团队)
专题命中 规划决策 :agent(abstract);tool use(abstract);planning(abstract);分类 cs.AI、cs.CL
AI总结 CocoaBench评估统一数字代理在多样化场景中的表现,通过人类设计的长周期任务测试其视觉、搜索和编码能力的灵活组合,发现当前代理在推理、规划和视觉理解方面仍有较大提升空间。
Comments Project page: https://cocoabench.github.io/
利用大型语言模型在多个软件平台间自动化结构分析
机构 * University of Miami(迈阿密大学) ; HBC Engineering Company(HBC工程公司) ; Hunan University(湖南大学) ; Lehigh University(里海大学)
专题命中 规划决策 :agent(abstract);workflow(abstract);multi-agent(abstract);分类 cs.AI、cs.SE
AI总结 本文提出一种多软件平台结构分析自动化方法,通过两阶段多智能体架构实现跨平台建模与分析,实验表明其在多个主流软件中均达到90%以上的准确率。
大语言模型能感知时间吗?一项实证研究
机构 * TCS Research(塔塔咨询服务公司研究院)
专题命中 规划决策 :agent(abstract);planning(abstract);agentic(abstract);分类 cs.AI、cs.CL
AI总结 研究探讨大语言模型在时间估计上的局限性,通过68项任务和四类模型进行实验,发现模型在预任务估计、相对排序和事后回忆中均存在显著误差,表明模型缺乏对自身推理时间的体验性认知。
Comments ICLR 2026 I Can't Believe It's Not Better Workshop