arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

AI Agent

智能体、工具调用、规划、工作流、多智能体和自主任务执行。

共收录 7434 信号源:cs.AI, cs.CL, cs.LG, cs.SE

1. 规划决策 2137 篇

2606.08596 2026-06-09 cs.AI cs.HC 新提交 70%

Distilling LLM Reasoning into an Interpretable Policy Tree for Human-AI Collaboration

将LLM推理蒸馏为可解释的策略树用于人机协作

Beiwen Zhang, Yongheng Liang, Guowei Zou, Haitao Wang, Hejun Wu

机构 * Sun Yat-sen University(中山大学)

专题命中 规划决策 :agent(abstract);multi-agent(abstract);分类 cs.AI

AI总结 提出Co-pi-tree方法,通过将大语言模型推理蒸馏为可执行策略树,在Overcooked-AI中平均奖励提升35.4%,同时减少77.7%的LLM查询和97.1%的测试延迟。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.07974 2026-06-09 cs.RO cs.AI 新提交 70%

PRISM: PRior-guided Imagination Sampling in world Models

PRISM:世界模型中基于先验引导的想象采样

Yuhai Wang, Jiawei Xia, Rongxuan Zhou, Xiao Hu, Yongliang Shi, Jing Du, Yang Ye

机构 * Northeastern University(东北大学) University of California, Berkeley(加州大学伯克利分校) Qiyuan Lab(启元实验室) University of Florida(佛罗里达大学)

专题命中 规划决策 :agent(abstract);planning(abstract);分类 cs.AI

AI总结 提出PRISM框架,通过从世界模型编码器提取状态条件高斯先验,并利用精度加权高斯乘积更新规划器的采样分布,在不增加架构复杂度的情况下显著提升基于模型的连续控制性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.06836 2026-06-08 cs.RO cs.AI cs.CV 新提交 70%

Think Like a Pilot: Fine-Grained Long-Horizon UAV Navigation

像飞行员一样思考:细粒度长时程无人机导航

Xiangyi Zheng, Xiangyu Wang, Qinan Liao, Zimu Tang, Yue Liao, Dongyue Lyu, Guodong Wang, Junjie Liu, Si Liu

机构 * Colab Beihang University(北航) Meituan(美团) National University of Singapore(新加坡国立大学)

专题命中 规划决策 :agent(abstract);planning(abstract);分类 cs.AI

AI总结 提出FLIGHT基准和FLIGHT VLA异步架构,通过低频飞行员推理VLM与高频扩散动作模型解耦,实现无人机长时程语义指令下的平滑连续飞行控制。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.06673 2026-06-08 cs.LG 新提交 70%

Uncertainty-Aware LLM-Guided Policy Shaping for Sparse-Reward Reinforcement Learning

不确定性感知的LLM引导策略塑形用于稀疏奖励强化学习

Ujjwal Bhatta, Utsabi Dangol, Sumaly Bajracharya, Rodrigue Rizk, KC Santosh

机构 * USD AI Research Lab(USD人工智能研究实验室)

专题命中 规划决策 :agent(abstract);multi-agent(abstract);分类 cs.LG

AI总结 提出ULPS框架,结合校准的大语言模型与不确定性估计,通过A*轨迹微调BERT模型提供动作建议,并用熵机制平衡LLM引导与PPO策略,在MiniGridUnlockPickup基准上显著提升成功率、奖励效率和样本复杂度。

Comments Accepted to the 2026 IEEE Conference on Artificial Intelligence (IEEE CAI). 6 pages, 3 figures. Code available at: https://github.com/USD-AI-ResearchLab/uncertainty-aware-llm-rl

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.12497 2026-07-15 cs.CV 新提交 69%

TerraLogic: A Benchmark for Hierarchical Geospatial Reasoning in Earth Observation

TerraLogic:地球观测中分层地理空间推理的基准

Yuhang Yan, Linchao Mou, Bokang Yang, Qingyu Li

机构 * The Chinese University of Hong Kong (Shenzhen)(香港中文大学(深圳)) Technical University of Munich(慕尼黑工业大学)

专题命中 规划决策 :agent(abstract,comments);planning(abstract)

AI总结 针对遥感中认知地理空间推理研究不足的问题,引入TerraLogic基准及HieraPlan工具增强智能体,通过545个任务推动评估向认知级发展,实验显示HieraPlan在分层地理空间推理上表现出色,为相关研究提供强大基线。

Comments 8 pages, 3 figures, and 7 tables. Dataset and agent code are available at https://github.com/Ireliya/TerraLogic

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.27176 2026-08-28 cs.CL cs.AI cs.LG eess.AS 新提交 67%

When Text Misleads: Inconsistent-Aware Reasoning for Audio-Grounded Dialogue

当文本误导时:面向音频接地对话的不一致感知推理

Yen-Ju Lu, Yuzhe Wang, Yaohan Guan, Xiluo He, Jiarui Hai, Mingrui Liang, Kaavya Chaparala, Thomas Thebaud, Laureano Moro-Velazquez, Najim Dehak, Jesus Villalba

机构 * Center for Language and Speech Processing, Johns Hopkins University(约翰霍普金斯大学语言与语音处理中心)

专题命中 规划决策 :agentic(abstract);分类 cs.AI、cs.CL、cs.LG

AI总结 本研究针对口语对话理解中基于转录本的捷径问题,构建了含501个问题的受控基准ContraTalk,提出Audio Twin智能体式推理框架,可提升冲突问答案例的准确率并减少文本偏向陷阱选择。

Comments 24 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.25117 2026-08-27 cs.HC 新提交 67%

Teaching Geometric Proof with Tech: Pitfalls and Possibilities

技术辅助几何证明教学:误区与可能性

Hwei-Shin Harriman, Wode Ni, Yuchen Jin, Dominik Moritz, Joshua Sunshine

专题命中 规划决策 :planning(abstract);workflow(abstract)

AI总结 该研究通过访谈18名几何教师、审查33款工具,发现数字工具在几何证明正式教学中存在不足,进而提出四项教育证明工具的设计准则。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.24817 2026-08-26 cs.CE 新提交 67%

A Co-Simulation Platform Coupling Land Use, Transportation, and Building Energy: Development and Case Study

耦合土地利用、交通与建筑能源的协同仿真平台:开发与案例研究

Gopindra Sivakumar Nair, Yilin Jiang, Samuel Maurer, James Cook, Nazmul Arefin Khan, Joshua A. Auld, Tianzhen Hong, Arezoo Besharati, Paul Waddell

专题命中 规划决策 :agent(abstract);workflow(abstract)

AI总结 该研究开发了集成UrbanSim、POLARIS、CityBES的协同仿真平台,以芝加哥大都市区为例验证其可评估交通与定价政策对土地利用、出行和能源的联合影响。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.24215 2026-08-26 cs.MA 新提交 67%

Agentopia on a Consumer GPU: A Reduced-Scale Long-Horizon Port with an 8B Model

消费级GPU上的Agentopia:采用8B模型的缩减规模长视距移植方案

Luo Huan

专题命中 规划决策 :agent(abstract);multi-agent(abstract)

AI总结 本文在单块消费级GPU上实现并评估了采用8B量化模型的缩减规模Agentopia移植方案,验证了其长视距模拟的可行性并发布了相关资源。

Comments 8 pages, 2 figures. Public preprint and research artifact

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.23402 2026-08-25 cs.DB 新提交 67%

EXPLAIN Yourself! Finding Query Planner Stalls Across DBMSes

解释你自己!跨数据库管理系统(DBMS)查询规划器停滞问题的发现

Geoffrey X. Yu, Ryan Marcus, Tim Kraska

专题命中 规划决策 :planning(abstract);agentic(abstract)

AI总结 本文通过轻量级智能体搜索发现7个DBMS中均存在规划耗时超3分钟的查询,分析其异常模式并公开相关查询及测试套件,指出查询规划的延迟与鲁棒性需重视。

Comments 7 pages, 9 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.22476 2026-08-25 cs.DB 新提交 67%

JetStream: Generating Query Accelerators for Existing Database Systems

JetStream:为现有数据库系统生成查询加速器

Akhilesh Balasingam, Amadou Ngom, Geoffrey X. Yu, Tim Kraska

专题命中 规划决策 :workflow(abstract);agentic(abstract)

AI总结 JetStream是扩展现有DBMS的查询专用加速器生成系统,经TPC-H等测试,其生成的有状态加速器对DuckDB等实现数百倍加速,还可泛化到新工作负载,能支持动态工作负载。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.22278 2026-08-25 cs.RO 新提交 67%

DreamMimic: Learning Visuomotor Whole-Body Loco-Manipulation via World Model

DreamMimic:通过世界模型学习视觉运动全身移动操作

Jie Yin, Xingyu Lai

机构 * Tsinghua University(清华大学)

专题命中 规划决策 :agent(abstract);planning(abstract)

AI总结 DreamMimic 框架通过世界模型辅助蒸馏,将特权教师策略提炼为基于视觉的人形机器人控制器,引入 PCG 平衡引导与探索,在 OMOMO 和 BEHAVE 上提升了视觉移动操作性能。

Comments accepted to IROS2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.22093 2026-08-25 cs.RO 新提交 67%

EndoNav: Semantic-to-Geometric Grounding for Language-Guided Robotic Endoscopic Examination

EndoNav:面向语言引导的机器人内窥镜检查的语义到几何的 grounding(语义几何关联)

Jecia Z. Y. Mao, Hisashi Ishida, Kathryn Jung, Masaru Ishii, Russell H. Taylor, Manish Sahu

专题命中 规划决策 :agent(abstract);planning(abstract)

AI总结 研究人员提出 EndoNav 框架,可将外科医生高级命令转换为患者特异性鼻窦解剖内的自主内窥镜可视化行为,其可视化效果接近住院外科医生水平,验证了该方法的可行性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.21438 2026-08-25 cs.CV cs.MA 新提交 67%

DesignAgent3D: Interactive 3D Scene Editing via Designer-like Multimodal Reasoning

DesignAgent3D:通过类设计师多模态推理实现交互式3D场景编辑

Xiujin Liu, Tianyu Yang, Yilun Zhao, Xiangliang Zhang

机构 * University of Michigan(密歇根大学) University of Notre Dame(圣母大学) Yale University(耶鲁大学)

专题命中 规划决策 :agent(abstract);agentic(abstract)

AI总结 DesignAgent3D是一种交互式多模态智能体框架,通过类设计师的规划-感知-行动范式解决文本引导3D场景编辑的缺陷,在NeRF和3D Gaussian Splatting上均优于现有方法,实现了更优的语义对齐、空间定位精度和多视图一致性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.19072 2026-08-20 cs.AI cs.CL cs.LG 新提交 67%

What is Missing from AI Post-Training AI: An Empirical Analysis

AI后训练AI缺失了什么?一项实证分析

Joy Jia Yin Lim, Xin Huang, Hao Peng, Yaxi Lu, Xin Cong, Zhong Zhang, Maosong Sun, Yankai Lin

机构 * Tsinghua University(清华大学) University of Electronic Science and Technology of China(电子科技大学) Renmin University of China(中国人民大学)

专题命中 规划决策 :agent(abstract);分类 cs.AI、cs.CL、cs.LG

AI总结 本文通过实证分析发现,LLM智能体后训练时存在策略锁定问题,其缺失的是执行过程中自发重新评估训练策略的机制,而非经验、指导或推理计算。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.18353 2026-08-20 eess.SY cs.MA cs.SY 新提交 67%

Model Predictive Supervisory Control for Hierarchical and Distributed UAS Traffic Management

面向分层分布式无人机交通管理的模型预测监督控制

Matheus P. Loures, Guilherme V. Raffo, Patrícia N. Pena

专题命中 规划决策 :agent(abstract);multi-agent(abstract)

AI总结 本研究提出分层模型预测监督控制(MPSC)框架,结合滚动时域最优控制与监督控制理论保障安全等特性,开发城市UTM模型,实现时变需求下取送任务的高效支持。

Comments 6 pages, 7 figures, IFAC conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.17414 2026-08-19 cs.CV cs.PL 新提交 67%

REChart: Reasoning-Efficient Chart Editing with Large Reasoning Models

REChart:基于大型推理模型的推理高效图表编辑方法

Yuanbang Liu, Chenxi Ruan, Yihan Hou, Qiong Luo, Wei Zeng

机构 * HKUST(GZ)(香港科技大学(广州))

专题命中 规划决策 :workflow(abstract);agentic(abstract)

AI总结 REChart是两阶段训练框架,通过过程级监督提升图表编辑的保真度与推理效率,在两个基准上实现同规模开源模型最优性能,推理token用量降低79.0%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.17146 2026-08-19 cs.RO 新提交 67%

PDDL-ART: Autonomous Symbolic Abstraction From Demonstration For Long-Horizon Robotic Manipulation Using Vision-Language Models

PDDL-ART:基于演示的自主符号抽象方法,用于使用视觉语言模型的长时程机器人操纵

Disha Kamale, Dmitry Berenson

机构 * University of Michigan(密歇根大学)

专题命中 规划决策 :tool-use(abstract);planning(abstract)

AI总结 PDDL-ART是一种基于VLM的框架,可自主从演示生成PDDL描述,经多阶段校正确保语义对齐,在发动机维护和家庭操纵任务上平均成功率达93.3%,优于基线规划器。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.17831 2026-08-19 astro-ph.IM 新提交 67%

Simulation tools for realistic high-order wavefront correction with the Roman Coronagraph

用于罗曼日冕仪真实高阶波前校正的模拟工具

A. Lau, A. J. Riggs, S. F. Redmond, E. Cady, J. Krist, I. Laginja, D. Sirbu, L. Delaye, R. Soummer, S. Noiret, J. C. Lambert, A. Bidot

专题命中 规划决策 :planning(abstract);workflow(abstract)

AI总结 本文介绍了可配置模拟框架corgihowfsc,用于罗曼日冕仪真实高阶波前校正研究,可保留参考工作流程并结合高保真图像模型,支持受控对比研究。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.16635 2026-08-18 cs.CE 新提交 67%

AccountAgent: AI Accounting Assistant System

AccountAgent:AI会计助手系统

Yulu Huang, Niannian Yu, Yaxin Yang, Jinpeng Lv

专题命中 规划决策 :agent(abstract);planning(abstract)

AI总结 AccountAgent是一款AI会计助手系统,依托机器学习等技术实现会计全流程自动化,解决传统会计痛点,推动行业向管理导向转型。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.16195 2026-08-18 cs.RO 新提交 67%

RoboStriker: Latent-Space Strategic Games for Autonomous Humanoid Boxing

RoboStriker:用于自主人形机器人拳击的隐空间策略博弈

Kangning Yin, Kaige Liu, Zhe Cao, Wentao Dong, Weishuai Zeng, Tianyi Zhang, Qiang Zhang, Jingbo Wang, Jiangmiao Pang, Yang Li, Ming Zhou, Weinan Zhang

机构 * Shanghai Jiao Tong University(上海交通大学) Shanghai Artificial Intelligence Laboratory(上海人工智能实验室) Shanghai Innovation Institute(上海创新研究院) Huazhong University of Science and Technology(华中科技大学) University of Science and Technology of China(中国科学技术大学)

专题命中 规划决策 :agent(abstract);multi-agent(abstract)

AI总结 本研究提出RoboStriker框架,将人形拳击任务形式化为隐空间零和马尔可夫博弈,通过分层结构解耦推理与执行,实现了优于原始动作空间方法的战术性能并成功部署到现实人形机器人。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.14828 2026-08-18 cs.AI cs.CL cs.LG 新提交 67%

MINT: Min-Selection Preference Distillation for Balanced Multi-Objective Alignment

MINT:用于平衡多目标对齐的最小选择偏好蒸馏

Tony Tu, Sayan Chakraborty, Ruomeng Xu, Tony Qin, Austin Tian

机构 * Georgia Institute of Technology(佐治亚理工学院) Zillow Group(齐洛集团)

专题命中 规划决策 :agent(abstract);分类 cs.AI、cs.CL、cs.LG

AI总结 该研究针对多目标对齐的不平衡问题,提出MINT方法,通过按最弱目标排名候选替代加权和排名,在情感支持等任务中显著提升双目标表现并降低不平衡性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.14160 2026-08-17 cs.RO 新提交 67%

OccPlanner: Goal-Aware Occupancy-Conditioned Diffusion Planner for Pixel-Goal Navigation

OccPlanner:面向像素目标导航的目标感知占用条件扩散规划器

Binling Huang, Nianjin Ye, Xi Yang, Liang Hu, Zhou Huang, Shuang Wei, Longrui Yang, Yanchi Chen, Lanpeng Jia

机构 * Changhong Intelligent Robot(长虹智能机器人) University of Electronic Science and Technology of China(电子科技大学)

专题命中 规划决策 :agent(abstract);planning(abstract)

AI总结 该研究针对像素目标导航的3D目标定位与无碰撞规划难题,提出OccPlanner模型,引入L3ROcc生成监督,在仿真中大幅提升导航成功率,还验证了其仿真到真实的迁移适配性。

Comments Technical report. 11 pages, 6 figures, and 2 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.12763 2026-08-14 cs.CE 新提交 67%

ARIES-Mission2: A Zero-Shot Vision-Language-Action Framework for Fast Large-Scale Aerial Mission Generation

ARIES-Mission2:用于快速大规模空中任务生成的零样本视觉-语言-动作框架

Junhao Wei, Yanxiao Li, Haochen Li, Yifu Zhao, Dexing Yao, Baili Lu, Zikun Li, Yapeng Wang, Sio-Kei Im, Dingcheng Yang, Xu Yang

专题命中 规划决策 :planning(abstract);workflow(abstract)

AI总结 ARIES-Mission2是解耦视觉语义感知与路径优化的零样本VLA框架,在UAV基准上,其飞行距离更短、任务生成速度更快,且TSP模块可扩展性佳。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.11357 2026-08-13 cs.MA 新提交 67%

When Do Institutions Beat Intelligence?

何时制度优于智能?

Zhengye Han

专题命中 规划决策 :agent(abstract);multi-agent(abstract)

AI总结 该研究通过构建受控人工生态,实验揭示制度在修复集体构建可用公共状态的失败时优于智能,反之则不然,为智能与制度的选择提供了诊断依据。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.09516 2026-08-11 cs.RO 新提交 67%

HarnessWAM: Bridging Prediction and Deliberation in World Action Models

HarnessWAM:弥合世界动作模型中的预测与审议差距

Zhaopeng Gu, Bingke Zhu, Tianxi Lin, Guibo Zhu, Yingying Chen, Kai Wang, Tingyu Yuan, Chaoyang Zhao, Zhaowen Li, Peng Su, Jinqiao Wang

机构 * Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所) School of Artificial Intelligence, University of Chinese Academy of Sciences(中国科学院大学人工智能学院) Yinwang Intelligent Technology Co., Ltd.(银湾智能科技有限公司) Beijing Institute of Technology(北京理工大学) Wuhan AI Research(武汉人工智能研究院)

专题命中 规划决策 :planning(abstract);agentic(abstract)

AI总结 针对世界动作模型的预测-审议差距,提出HarnessWAM框架,通过双时间尺度反馈环等机制,在两个基准数据集上取得最优任务成功率,扩展了WAMs的具身任务执行能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.07825 2026-08-11 cs.CY cs.HC 新提交 67%

AI as a Democratizing Force in Indie Game Development

AI作为独立游戏开发中的民主化力量

Brian Madanamootoo, Jatin Alla

专题命中 规划决策 :planning(abstract);agentic(abstract)

AI总结 该研究考察AI对2024-2026年游戏行业分化的影响,发现AI大幅降低独立游戏制作的协调成本,推动第三波民主化浪潮,披露AI的游戏接受度与传统游戏相当,但市场已呈现结构性过剩的前提条件。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.04634 2026-08-06 cs.MA 新提交 67%

HELENA:Hierarchical Sparse Coordination over a Union of Complementary Topologies for MAS

HELENA:面向多智能体系统的互补拓扑联合上的分层稀疏协调框架

Zhifang Mao, Linyao Zheng, Xuhang Shi, Xiuquan Hou

专题命中 规划决策 :agent(abstract);multi-agent(abstract)

AI总结 HELENA 是一种 MAS 框架,通过互补拓扑联合与分层稀疏协调抑制冗余噪声,在八个基准测试上实现最优结果,平均提升 3.47%,MMLU-Pro 最高提升 10.34%,难基准提升更显著且附加成本合理。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.04434 2026-08-06 cs.CV 新提交 67%

OmniRouting: A Semantic-Coupled Multimodal Benchmark for Constraint-Aware Spatial Reasoning in PCB Routing

OmniRouting:面向PCB布线中约束感知空间推理的语义耦合多模态基准

Taiting Lu, Kaiyuan Lin, Ziwei Dong, Sisong Bei, Haolin Ye, Yuxin Tian, Runze Liu, Mingjia Wang, Jingying Zeng, Hongxing Pan, Kai Zhang, Haoyu Wang, Guoliang Shi, Ling Ma, Yifan Yang, Jiaying Lu, Qi He, Yi-Chao Chen, Sung-Liang Chen, Yincheng Jin, Mahanth Gowda

专题命中 规划决策 :planning(abstract);agentic(abstract)

AI总结 本研究针对LLMs在PCB布线推理上的能力缺口,构建了OmniRouting基准,含1681个工业级PCB设计及四项任务,发现现有LMMs存在显著局限并计划开源相关资源。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.01964 2026-08-04 cs.CV 新提交 67%

LongHorizon-Harness: Advancing Long-Horizon Agents for Real-World Tasks

LongHorizon-Harness:推进面向真实世界任务的长时程智能体

Ziyu Ma, Hailang Huang, Shun Zou, Yong Wang, Shidong Yang, Yiming Hu, Fei Wei, XiangXiang Chu

机构 * Alibaba Group(阿里巴巴集团)

专题命中 规划决策 :agent(abstract);tool use(abstract)

AI总结 本研究提出LongHorizon-Harness框架,通过MEA循环等设计解决长时程智能体的状态追踪与错误传播问题,在多个基准测试中显著提升了Qwen、Claude等模型的表现。

Comments 29 pages

详情

展开后加载摘要…

URL PDF HTML 收藏