arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

AI Agent

智能体、工具调用、规划、工作流、多智能体和自主任务执行。

共收录 35547 信号源:cs.AI, cs.CL, cs.LG, cs.SE

1. 规划决策 35547 篇

2103.03359 2021-05-04 cs.AI cs.LG cs.MA cs.NE 80%

Cognitive Homeostatic Agents

Amol Kelkar

专题命中 规划决策 :autonomous agent(abstract,journal_ref);agent(abstract);planning(abstract);分类 cs.AI、cs.LG

Comments Accepted at AAMAS2021 Blue Sky Ideas Track

Journal ref In Proc. of the 20th International Conference on Autonomous Agents and Multiagent Systems (AAMAS 2021), Online, May 3-7, 2021, IFAAMAS, 5 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.21204 2026-08-24 cs.RO cs.LG 新提交 79%

Beyond Imitation: Self-Improving Robot Policies via Off-Policy Q-Planning

超越模仿:基于离线Q规划的机器人策略自改进

Varun Giridhar, Anant Khandelwal, Jeremy A. Collins, Ignat Georgiev, Animesh Garg

机构 * Georgia Institute of Technology(佐治亚理工学院)

专题命中 规划决策 :planning(title,abstract);分类 cs.LG

AI总结 该研究提出Q规划方法,为大型视觉运动BC策略配备离线Q函数,通过仅微调Q函数实现自改进,在仿真和真实机器人任务中均显著提升机器人操作性能,且优于多种对比方法。

Comments Project page with videos: this https URL (https://varungiridhar.github.io/qplanning/)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.21186 2026-08-24 cs.LG 新提交 79%

A Neurosymbolic Approach for Constructing Planning Domain Models from Clinical Narratives

一种从临床叙事构建规划领域模型的神经符号方法

Ranveer Singh, Saurabh Mathur, Michael Skinner, Prasad Tadepalli, Kristian Kersting, Sriraam Natarajan

专题命中 规划决策 :planning(title,abstract);分类 cs.LG

AI总结 针对临床叙事难以构建外科手术概率规划模型的问题,提出神经符号框架NSPIN,结合预训练LLM从2660份阑尾切除术记录生成的模型可泛化且符合临床实践。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.21157 2026-08-24 cs.DC cs.AI 新提交 79%

HIERA: Workload-Aware Planning Across Implementation Spaces for GPU Kernel Optimization

HIERA:面向GPU内核优化的跨实现空间工作负载感知规划

Jinghao Wang, Qiqi Gu, Chenpeng Wu, Jianguo Yao, Haibing Guan, Xijun Li

专题命中 规划决策 :planning(title,abstract);分类 cs.AI

AI总结 HIERA是一种跨实现空间的GPU内核优化分层规划框架,在KernelBench实验中优于无训练方法,还在科学计算模板算子上实现1.53倍加速,无需额外训练即可接近CUDA-L1性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.20510 2026-08-24 cs.AI 新提交 79%

A Temporal Planning Approach for Intelligent Flood Response

面向智能防洪响应的时序规划方法

Fazlul Hasan Siddiqui, Md. Monjurul Islam, Sabah Binte Noor

机构 * Dhaka University of Engineering & Technology(达卡工程技术大学) Bangladesh Army University of Engineering & Technology(孟加拉国陆军工程技术大学)

专题命中 规划决策 :planning(title,abstract);分类 cs.AI

AI总结 本研究提出一种智能防洪响应框架,利用时序规划技术建模防洪响应全生命周期,整合多类关键要素并支持执行中重规划,通过两种规划语言表述,实验验证其可行性与可扩展性并指导规划器选择。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.27204 2026-08-24 cs.CR cs.SE 版本更新 79%

MalSkills: Detecting Malicious Skills in the Agentic Supply Chain via Neuro-symbolic Reasoning

我的爱,华生。通过神经符号推理跨异构工件检测恶意技能

Shenao Wang, Junjie He, Yanjie Zhao, Yayi Wang, Kan Yu, Haoyu Wang

专题命中 规划决策 :agentic(title,abstract);分类 cs.SE

AI总结 本文提出MalSkills框架,通过符号解析与LLM语义分析提取异构工件中的安全敏感操作,构建技能依赖图并进行神经符号推理,实现恶意技能检测,实验表明其在F1得分上优于现有方法。

Comments Accepted by ASE 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.20237 2026-08-21 cs.AI 新提交 79%

Rule-Compliant Visual Spatial Planning for Multimodal Large Language Models

面向多模态大语言模型的符合规则的视觉空间规划

Yu Chen, Ting Lei, Yaoyi Li, Jia Cai, Zhecen Wu, Yang Liu

机构 * Wangxuan Institute of Computer Technology, Peking University(北京大学王选计算机研究所) Yinwang Intelligent Technology Co., Ltd(银湾智能科技有限公司)

专题命中 规划决策 :planning(title,abstract);分类 cs.AI

AI总结 该研究针对多模态大语言模型的规则遵循空间规划问题,构建了RuleMaze基准,提出语言-逻辑-函数混合方法和解耦多模态规划(DMP),提升了规则遵循度与规划成功率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.19842 2026-08-21 cs.AI 新提交 79%

SAPO: Single-Rollout Autoregressive Policy Optimization for Agentic Reinforcement Learning

SAPO:用于智能体强化学习的单回滚自回归策略优化

Dayang Liang, Lang Feng, Bo An, Yunlong Liu

机构 * Xiamen University(厦门大学) Nanyang Technological University(南洋理工大学)

专题命中 规划决策 :agentic(title,abstract);分类 cs.AI

AI总结 本研究针对智能体强化学习现有方法的三大局限,提出SAPO框架,其共享策略与价值函数的自回归主干,结合广义优势估计器,在ALFWorld、WebShop任务上性能优于PPO和GRPO,内存与计算效率更高。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.15654 2026-08-21 cs.RO cs.AI 版本更新 79%

PO-PDDL: Learning Symbolic POMDPs from Visual Demonstrations for Robot Planning Under Uncertainty

PO-PDDL: 从视觉演示中学习符号化POMDP以实现不确定性下的机器人规划

Wenjing Tang, Xuanjin Jin, Yuan Liu, Renming Huang, Cewu Lu, Panpan Cai

机构 * Shanghai Jiao Tong University(上海交通大学) Shanghai Innovation Institute(上海创新研究院)

专题命中 规划决策 :planning(title,abstract);分类 cs.AI

AI总结 提出PO-PDDL符号化POMDP框架,通过从机器人执行视频中重建潜在状态轨迹、识别部分可观测性并学习随机转移与观测模型,实现不确定性下的鲁棒任务规划。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.21874 2026-08-21 cs.RO cs.AI 版本更新 79%

A Physics-Informed Neural Network Approach for UAV Path Planning in Dynamic Environments

动态环境下无人机路径规划的物理信息神经网络方法

Shuning Zhang

专题命中 规划决策 :planning(title,abstract);分类 cs.AI

AI总结 针对动态环境下无人机路径规划问题,提出PINN框架,将动力学等约束嵌入学习,仿真显示其在多指标上优于A*等传统方法,可统一模型与数据驱动规划。

Comments Withdrawn due to a substantive methodological error that affects the main conclusions of the paper

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.18846 2026-08-20 cs.AI 新提交 79%

ORBITER: Conflict-Aware Decision-Making for Agentic Last-Mile Delivery

ORBITER:面向智能体的最后一公里配送的冲突感知决策方法

Mingzhao Li, Chenxi Liu, Yan Zhao, Hao Miao

专题命中 规划决策 :agentic(title,abstract);分类 cs.AI

AI总结 本文针对最后一公里配送决策的可解释性与可靠性问题,提出ORBITER框架,结合LLM与结构化决策机制,在四城市数据上较最优基线平均提升9.2%,验证了方法的有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.18682 2026-08-20 cs.AI 新提交 79%

RTPO: Reverse-Turn Policy Optimization for Stabilizing Agentic RL Training

RTPO:用于稳定智能体强化学习训练的反向回合策略优化

Yugu Li, Jimmy Cao, Jianglin Qiao, Siyi Hu

机构 * Adelaide University(阿德莱德大学) The University of Sydney(悉尼大学) Curtin University(科廷大学) School of CSIT(计算机科学与信息技术学院) ACFR(澳大利亚空间研究中心) School of EECMS(电子工程、计算机与数学科学学院)

专题命中 规划决策 :agentic(title,abstract);分类 cs.AI

AI总结 针对多回合智能体RL训练不稳定问题,提出RTPO方法,通过反向回合策略优化消除上下文不匹配与异步漂移,实验显示其较基线提升21.50%、10.76%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.16149 2026-08-20 cs.AI 版本更新 79%

Teaching agentic AI to learn expert reasoning for rare disease diagnosis

LiteOdyssey: 一种用于可解释罕见病诊断的轻量级推理AI智能体

Minh-Ha Nguyen, Erica Gray, Bryce A. Schuler, Kevin W. Byram, Chih-Ting Yang, Fan Ma, Hua Xu, Wu-Chen Su, Chao Yan, Wei-Qi Wei, Adam Wright, Lisa Bastarache, Josh F. Peterson, Lingyao Li, Siyuan Ma, Undiagnosed Diseases Network, Rizwan Hamid, Thomas A. Cassini, Cathy Shyr

机构 * Vanderbilt University(范德堡大学) Vanderbilt University Medical Center(范德堡大学医学中心) University of South Florida(南佛罗里达大学)

专题命中 规划决策 :agentic(title,abstract);分类 cs.AI

AI总结 提出轻量级框架LiteOdyssey,通过人类-AI协作的诊断策略和公共生物医学工具增强单个推理语言模型,在罕见病诊断基准上达到最先进性能,无需微调或多智能体集成。

Comments Updated abalation experiments and layout

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.07464 2026-08-20 cs.RO cs.AI cs.CV 版本更新 79%

Planning-aligned Token Compression for Long-Context Autonomous Driving

面向长上下文自动驾驶的规划对齐令牌压缩

Zhixuan Liang, Yuxiao Chen, Yurong You, Peter Karkus, Wenhao Ding, Boyi Li, Alexander Popov, Yan Wang, Maximilian Igl, Yiming Li, Danfei Xu, Nikolai Smolyanskiy, Boris Ivanovic, Ping Luo, Marco Pavone

机构 * NVIDIA Research(NVIDIA研究) School of Computing and Data Science, The University of Hong Kong(计算与数据科学学院,香港大学)

专题命中 规划决策 :planning(title,abstract);分类 cs.AI

AI总结 提出COMPACT-VA框架,基于条件VQ-VAE将长上下文压缩为有界表示,通过规划对齐实现决策关键信息保留,在动态场景中成功率提升超6%,速度提升3.3倍。

Comments Accepted by IEEE Robotics and Automation Letters (RA-L) 2026. 8 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.14635 2026-08-19 cs.DC cs.LG 版本更新 79%

Belayer: Efficient Fault Tolerance for LLM Agentic RL Training

Belayer:面向LLM智能体强化学习训练的高效容错机制

Jiecheng Zhou, Qinghao Hu, Peng Sun, Xingcheng Zhang, Weiming Zhang

专题命中 规划决策 :agentic(title,abstract);分类 cs.LG

AI总结 本文提出Belayer系统,针对LLM智能体强化学习训练的生成引擎和环境故障设计容错机制,可降低无故障训练开销,大幅缩短工作节点与环境故障的恢复时间。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.08713 2026-08-19 cs.AI cs.CV cs.RO 版本更新 79%

Towards Unified World Models for Visual Navigation via Memory-Augmented Planning and Foresight

通过记忆增强的规划和前瞻性构建视觉导航的统一世界模型

Yifei Dong, Fengyi Wu, Guangyu Chen, Lingdong Kong, Qiyu Hu, Yuxuan Zhou, Xu Zhu, Jingdong Sun, Jun-Yan He, Qi Dai, Alexander G. Hauptmann, Zhi-Qi Cheng

机构 * University of Washington(华盛顿大学) National University of Singapore(新加坡国立大学) Apple(苹果公司) Microsoft Research(微软研究院) Carnegie Mellon University(卡内基梅隆大学)

专题命中 规划决策 :planning(title,abstract);分类 cs.AI

AI总结 本文提出UniWM,一种整合视觉前瞻性与规划的统一世界模型,通过记忆机制提升导航鲁棒性和泛化能力,在多个基准测试中显著提升导航成功率。

Comments Accepted to ECCV 2026. 22 pages, 12 figures, code: https://github.com/UWMILab/UniWM

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.16889 2026-08-18 cs.RO cs.AI cs.CV 新提交 79%

Don't Drop the BATON: Long-Horizon Robot Manipulation via Agentic Subtask Exploration and Transition-aware Memory

不要放弃BATON:通过智能体子任务探索和感知转换的记忆实现长程机器人操作

Bingxin Xu, Yuzhang Shang, Emilio Ferrara

机构 * University of Southern California(南加州大学) University of Central Florida(中佛罗里达大学)

专题命中 规划决策 :agentic(title);agent(abstract);分类 cs.AI

AI总结 该研究针对长程机器人操作的误差累积与子任务转换问题,提出BATON方法,通过子任务探索与感知转换记忆,在RoboMemArena基准上提升任务成功率11.6%、累计成功率14.9%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.16457 2026-08-18 cs.CV cs.AI 新提交 79%

Contrastive Energy Fields for Inference-Time Procedure Planning in Instructional Videos

用于教学视频中推理时流程规划的对比能量场(CEFITO)

Mohamed Afham, Christoph Reich, Oliver Hahn, Daniel Cremers, Stefan Roth

机构 * TU Darmstadt(达姆施塔特工业大学) TU Munich(慕尼黑工业大学)

专题命中 规划决策 :planning(title,abstract);分类 cs.AI

AI总结 针对现有流程规划方法缺乏任务逻辑约束的问题,提出CEFITO方法,将流程规划构建为任务约束优化问题,在两个基准上取得最先进准确率。

Comments To appear at GCPR 2026 (oral paper). Project page: https://visinf.github.io/cefito

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.16287 2026-08-18 cs.LG 新提交 79%

SCALE: State-Calibrated Latent Embeddings for JEPA Planning in the Right Geometry

SCALE:用于正确几何空间中JEPA规划的状态校准潜在嵌入

Jiaming Hu, Yan Zheng, Tian Wang

机构 * Boston University(波士顿大学) Unity Technologies(Unity科技公司)

专题命中 规划决策 :planning(title,abstract);分类 cs.LG

AI总结 该研究提出SCALE正则化器,为LeWM表示校准几何属性,在多任务、多求解器和多计算预算下均提升规划性能,证明规划依赖信息对几何的塑造作用。

Comments 15 pages, 2 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.16055 2026-08-18 cs.AI 新提交 79%

Governance at the Boundary: How Agent Decomposition Degrades Policy Compliance

边界处的治理:智能体分解如何降低政策合规性

Bowen Li, Guojun Wang

机构 * LinkedIn(领英) Uber(优步)

专题命中 规划决策 :agent(title,abstract);分类 cs.AI

AI总结 该研究推出金融智能体可治理性基准Fiducia-bench,发现智能体分解会降低政策合规性,且弱化程度与模型能力相关,相关资源均开源。

Comments 8 pages, 3 tables, 1 figure. Preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.15291 2026-08-18 cs.AI 新提交 79%

ReasonCast: Agentic Demand Forecasting with Selective Semantic Reasoning

ReasonCast:基于选择性语义推理的智能体需求预测

Ziyue Yang, Chaolin Xu, Yijing Wang, Tiankai Gu, Hui Yang, Yanhong Lin, Kaiyuan Liu, Fei Xiao

机构 * Taobao and Tmall Group, Alibaba Group(阿里巴巴集团淘宝天猫集团)

专题命中 规划决策 :agentic(title);agent(abstract);分类 cs.AI

AI总结 ReasonCast是结构化语义干预框架,通过选择性语义推理结合多类信息,在三类场景降低WMAPE,且可避免稳定期无差别干预的负面影响。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.15165 2026-08-18 cs.AI 新提交 79%

SkillCommit: Evolving Agent Skills through Behaviorally Validated Scope Expansion

SkillCommit:通过行为验证的范围扩展实现智能体技能演化

Yu He, Weikai Yang

专题命中 规划决策 :agent(title,abstract);分类 cs.AI

AI总结 本研究提出SkillCommit框架,通过保留经验的验证行为、抽象相关技能,在RuleArena等数据集上提升智能体性能,且所学技能可跨模型迁移。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.14582 2026-08-18 cs.AI 版本更新 79%

A Temporal Planning Framework for Disruption Aware Dynamic Route Optimization in Heterogeneous Railway Systems

异构铁路系统中干扰感知的动态路径优化的时间规划框架

Pollob Chandra Ray, Sabah Binte Noor, Fazlul Hasan Siddiqui

机构 * Dhaka University of Engineering & Technology(达卡工程技术大学)

专题命中 规划决策 :planning(title,abstract);分类 cs.AI

AI总结 提出基于时间规划的框架,利用PDDL 2.1建模轨距兼容约束和多种干扰场景,生成无冲突时间戳操作计划,减少人工决策依赖。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.10584 2026-08-18 astro-ph.IM cs.AI gr-qc 79%

An agentic framework for gravitational-wave counterpart association in the multi-messenger era

一种用于多信使时代引力波反演关联的代理框架

Yiming Dong, Yacheng Kang, Junjie Zhao, Xinyuan Zhu, Ziming Wang, Lijing Shao

机构 * Department of Astronomy, School of Physics(天文学系,物理系) Kavli Institute for Astronomy and Astrophysics(天体物理研究所) Institute for Gravitational Wave Astronomy(引力波天文研究所) School of Information Science and Technology(信息科学与技术学院) National Astronomical Observatories(国家天文台)

专题命中 规划决策 :agentic(title,abstract);分类 cs.AI

AI总结 本文提出GW-Eyes框架,利用大语言模型实现引力波与电磁信号的自动关联,支持自然语言交互,提升多信使天文研究效率。

Journal ref The Innovation 7 (2026) 101538

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.06264 2026-08-18 cs.LG 版本更新 79%

Can Attribution Predict Risk? From Multi-View Attribution to Planning Risk Signals in End-to-End Autonomous Driving

属性能否预测风险?从多视图属性到端到端自动驾驶中的规划风险信号

Le Yang, Haijun Liu, Jiawei Liang, ShangQuan Sun, Xiaochun Cao

机构 * Sun Yat-sen University(中山大学) University of Chinese Academy of Sciences(中国科学院大学) Nanyang Technological University(南洋理工大学)

专题命中 规划决策 :planning(title,abstract);分类 cs.LG

AI总结 本文提出了一种层次化属性框架,用于端到端规划中的风险预测,通过提取三种属性统计作为预测信号,提升了对轨迹误差和碰撞检测的预测能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.17375 2026-08-18 cs.LG 版本更新 79%

MDP Planning as Policy Inference

MDP规划作为策略推断

David Tolpin

机构 * Offtopia

专题命中 规划决策 :planning(title,abstract);分类 cs.LG

AI总结 将周期性马尔可夫决策过程规划视为贝叶斯推断,通过策略作为隐变量,利用策略最优性的非归一化概率构建后验分布,结合变分序列蒙特卡洛方法近似后验分布,通过策略一致性扫面和粒子间转移随机性耦合避免模拟噪声干扰,最终通过后验预测采样生成随机控制策略。

Comments 29 pages, many figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.07084 2026-08-18 cs.RO cs.AI 版本更新 79%

Flow Motion Policy: Manipulator Motion Planning with Flow Matching Models

流运动策略:基于流匹配模型的机械臂运动规划

Davood Soleymanzadeh, Xiao Liang, Minghui Zheng

机构 * Zachry Department of Civil and Environmental Engineering, Texas A&M University(德克萨斯A&M大学Zachry土木与环境工程系)

专题命中 规划决策 :planning(title,abstract);分类 cs.AI

AI总结 本文提出流运动策略,一种基于流匹配模型的机械臂运动规划方法,通过生成路径分布实现高效推理优化。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.14452 2026-08-17 cs.AI 新提交 79%

SheetCompass: Hierarchical Relation Graphs for Agentic Spreadsheet Reasoning

SheetCompass:面向智能体电子表格推理的分层关系图

Panjing He, Mingyue Cheng, Yucong Luo, Li Li, Xiaohan Zhang

机构 * University of Science and Technology of China(中国科学技术大学)

专题命中 规划决策 :agentic(title,abstract);分类 cs.AI

AI总结 针对LLM处理电子表格时丢失多维结构语义的问题,提出SheetCompass框架,通过显式建模表内外结构关系并结合内存机制,提升智能体对复杂工作簿的推理能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.14354 2026-08-17 cs.AI 新提交 79%

ScienceFlow: A long-horizon agent for ML research, scientific discovery and beyond

ScienceFlow:面向机器学习研究、科学发现及更广泛领域的长时智能体

Mingming Zhao, Jiqian Dong, Kangping Xu, Zadid Hasan, Chengrui Fan, Shan Jiang, Shuai Mao, Ting Lingya, Linyi Zou, Tailin Zhou, Yun Hin Chan, Wenkai Zhang, Zhanhong Zhou, Guowei Huang, Hongliang Li, Wenjing Cun, Zhitang Chen, Mingxuan Yuan, Yanhui Geng

机构 * Noah’s Ark Lab, Huawei(华为诺亚方舟实验室)

专题命中 规划决策 :agent(title,abstract);分类 cs.AI

AI总结 ScienceFlow是一款端到端自主研究智能体框架,通过ESTRA机制与证据感知执行控制器实现长时研究的状态管理与资源分配,在24小时预算内的MLE-bench基准测试中取得70.22%的Any-Medal最优分数,为长时自主研究提供了有效方案。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.14312 2026-08-17 cs.CL 新提交 79%

Envs-FORGE: Frontier-Optimized Reward-Grounded Environment Synthesis for Agent RL

Envs-FORGE:面向智能体强化学习的前沿优化、奖励驱动的环境合成方法

Xiaojun Wu, Cehao Yang, Honghao Liu, Xueyuan Lin, Zhichao Shi, Hao Zhou, Xuhui Jiang, Chengjin Xu, Jia Li, Jian Guo

机构 * IDEA Research(IDEA研究院) The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州)) DataArcTech Ltd.(DataArcTech有限公司)

专题命中 规划决策 :agent(title);planning(abstract);分类 cs.CL

AI总结 Envs-FORGE是面向智能体RL的奖励驱动环境合成方法,通过MILP选动作生成训练环境,在多模型及数据集上显著提升Pass@1等指标。

Comments 19 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏