arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

AI Agent

智能体、工具调用、规划、工作流、多智能体和自主任务执行。

2026-08-24 至 2026-08-24 共收录 190 信号源:cs.AI, cs.CL, cs.LG, cs.SE

1. 工具调用 11 篇

2608.20389 2026-08-24 cs.AI 新提交 85%

Representation Affects Retrieval: A Case Study of Skill Discovery and Routing in a Multimodal Agent Harness

表征影响检索:多模态智能体框架中技能发现与路由的案例研究

Kevin Dela Rosa

机构 * Cloudglue USA(美国Cloudglue公司)

专题命中 工具调用 :agent(title,abstract);workflow(abstract,abstract_cn);分类 cs.AI

AI总结 该研究以多模态智能体框架Tinycloud为案例,发现提示内技能的部分暴露会产生词汇竞争,抑制正确技能选择,其为大规模技能路由提供了小规模视角。

Comments 5 pages, 1 figure, 3 tables. Accepted at AgentSearch '26 workshop at SIGIR 2026 (Melbourne, Australia, July 24, 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.01444 2026-08-24 cs.AI cond-mat.mtrl-sci cs.CL cs.LG math.CT 版本更新 85%

Self-Revising Discovery Systems for Science: A Categorical Framework for Agentic Artificial Intelligence

科学中的自我修正发现系统:面向主体人工智能的范畴论框架

Fiona Y. Wang, Markus J. Buehler

机构 * Laboratory for Atomistic and Molecular Mechanics(原子分子力学实验室) Department of Biological Engineering(生物工程系) Massachusetts Institute of Technology(麻省理工学院) Department of Civil and Environmental Engineering(土木与环境工程系) Department of Mechanical Engineering(机械工程系) Center for Computational Science and Engineering(计算科学与工程中心) Schwarzman College of Computing(施瓦茨曼计算学院)

专题命中 工具调用 :agentic(title,abstract);workflow(abstract);分类 cs.AI、cs.CL、cs.LG

AI总结 本文提出一个基于范畴论的框架,通过左Kan扩展实现科学发现中的表征体制转换,并应用于材料科学中的蛋白质力学和纤维网络建模。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.04786 2026-08-24 cs.LG cs.AI 版本更新 84%

AgentOCR: Reimagining Agent History via Optical Self-Compression

AgentOCR: 通过光学自压缩重新想象代理历史

Lang Feng, Fuchao Yang, Feng Chen, Xin Cheng, Haiyang Xu, Zhenglin Wan, Ming Yan, Bo An

机构 * NTU(国立科技大学)

专题命中 工具调用 :agent(title,abstract);agentic(abstract);分类 cs.AI、cs.LG

AI总结 AgentOCR通过光学自压缩技术,将代理历史转换为紧凑图像,从而在保持性能的同时显著减少token消耗和内存使用。

Comments Work in progress

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.20771 2026-08-24 cs.AI 新提交 83%

CAS: Conformalized Agentic Search via Adaptive Retrieval and Policy Weighting

CAS:通过自适应检索与策略加权实现的保形智能体搜索

Zixi Zhu, Jiayuan Su, Jian Zhang, Yu Lin, Hongwei Wang

机构 * Zhejiang University(浙江大学) ZJU-UIUC Institute, Zhejiang University(浙江大学ZJU-UIUC学院) Tencent Inc.(腾讯公司)

专题命中 工具调用 :agentic(title,abstract);agent(abstract);分类 cs.AI

AI总结 本研究针对搜索智能体RL微调的可靠性问题,提出CAS框架,通过自适应检索与策略加权结合CP技术,提升推理准确率并减少冗余搜索,构建高可靠高效智能体范式。

Comments 21 pages, including figures, tables, and appendix

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.20844 2026-08-24 cs.AI 新提交 79%

TRACE: Agentic Catalog Enrichment with Multi-source Evidence Grounding

TRACE:基于多源证据锚定的智能体式商品目录丰富

Rohan Kumar, Steven Xu, Kyle MacDonald, Matthew Long, Bernice Chow, Mac VanRenterghem, Sudeep Das

机构 * DoorDash(多闸道科技(DoorDash))

专题命中 工具调用 :agentic(title,abstract);分类 cs.AI

AI总结 针对电商商品目录属性稀疏问题,提出基于LLM的TRACE框架,经离线评估、生产部署及在线实验验证,可高效提升目录属性丰富的准确率、覆盖率及结账转化率。

Comments 12 pages, 2 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.21126 2026-08-24 cs.CR 新提交 75%

TraceGrant: A Contract-Governed Security Framework for the Task-Effect Lifecycle of Networked LLM Agents

TraceGrant:一种用于联网LLM智能体任务-效应生命周期的合约治理安全框架

Bohao Liao, Jingchao Wang, Qipeng Song, Jin Cao, Jieling Wang, Boyu Deng

专题命中 工具调用 :agent(abstract,abstract_cn);tool use(abstract)

AI总结 TraceGrant是通过显式合约治理联网LLM智能体任务-效应生命周期的安全框架,在两类基准攻击案例中未出现攻击成功,且能关联用户意图、执行与任务完成。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.20658 2026-08-24 cs.CR cs.ET 新提交 71%

The Claws in Plain Sight: Unauthorized Context Disclosure through LLM Agent Tool Calls

显而易见的爪痕:通过大语言模型智能体工具调用实现未授权的上下文信息泄露

Ben Dong, Zhonghao Guo, Tianyi Lu, Qian Wang

专题命中 工具调用 :agent(title)

AI总结 该研究提出Claw in Plain Sight攻击方法,通过构造任务相关内容框架诱导LLM智能体泄露上下文信息,实验显示其在多种模型上的会话级泄露率达20.8%-75.0%,提示需在工具参数执行前进行目的与目的地感知检查。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.16824 2026-08-24 cs.LG cs.CR cs.IR 版本更新 70%

GEO-Flag: Detecting and Measuring GEO-Optimized Web Content

GEO-Flag:检测与测量经GEO优化的网页内容

Junjie Chu, Ye Leng, Mingjie Li, Yun Shen, Xinyue Shen, Yang Zhang

机构 * CISPA Helmholtz Center for Information Security(CISPA亥姆霍兹信息安全中心) HPE(慧与科技) University of Waterloo(滑铁卢大学)

专题命中 工具调用 :agent(abstract,abstract_cn);分类 cs.LG

AI总结 本研究针对生成式引擎优化(GEO)网页检测不足的问题,构建GEOFlagBench基准,提出干预配对训练(IPT)方法,开发GEO门控智能体系统,还部署流程测量出GEO总体流行率为8.90%。

Comments 23 pages, 8 figures, 23 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.21027 2026-08-24 cs.AI 新提交 57%

Don't Solve, Just Compare: Tiny Advisors for Runtime Intervention in LLM Agents

无需解决,仅需比较:用于LLM智能体运行时干预的微型顾问

Yanze Jiang, Mingxuan Li, Yuhao Wang, Shengfang Zhai, Jiaheng Zhang

机构 * National University of Singapore(新加坡国立大学)

专题命中 工具调用 :tool use(abstract);分类 cs.AI

AI总结 本研究针对LLM智能体运行时干预需求,提出仅比较框架COTA,经多任务多执行器评估,其性能优于基线,可在辅助模型能力弱于执行器时实现有效干预。

Comments 21 pages, 1 figure, Preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.11818 2026-08-24 cs.CV cs.AI 版本更新 57%

MM-ToolSandBox: A Unified Framework for Evaluating Visual Tool-Calling Agents

MM-ToolSandBox:一个用于评估视觉工具调用智能体的统一框架

Kaixin Ma, Di Feng, Alexander Metz, Jiarui Lu, Eshan Verma, Afshin Dehghan

机构 * Apple(苹果公司)

专题命中 工具调用 :planning(abstract);分类 cs.AI

AI总结 介绍MM-ToolSandBox框架,它能支持多图像、多轮任务,通过自动化管道生成场景。评估12个先进模型发现当前模型视觉工具调用能力不足,视觉精度是瓶颈,不同规模模型失败原因不同,该框架和基准已公开。

Comments Benchmark link: this https URL (https://github.com/apple/ml-mmtoolsandbox)

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.08875 2026-08-24 cs.AI cs.SI physics.soc-ph 版本更新 57%

Online design of dynamic networks

动态网络的在线设计

Duo Wang, Andrea Araldo, Mounim El Yacoubi

机构 * Peking University(北京大学) Institut Polytechnique de Paris(巴黎理工学院)

专题命中 工具调用 :planning(abstract);分类 cs.AI

AI总结 本文提出一种基于蒙特卡洛树搜索的滚动时间规划方法,用于动态网络的在线设计,通过实时调整公交线路以适应随机需求,提升系统性能。

Comments 14 pages

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 规划决策 57 篇

2608.16386 2026-08-24 cs.CL cs.LG 版本更新 93%

Mint-Agent: Introducing Finance-Native Agentic Foundation Models

Mint-Agent:引入金融原生智能体基础模型

Mint-Agent Team, Kun Wang, Gavin Zhang, Yaze Geng, Lei Tang, Yaoyang Yi, Zonghan Wu, Yifan Hu, Qingsong Wen, Yilei Shao

专题命中 规划决策 :agent(title,title_cn);agentic(title,abstract);分类 cs.CL、cs.LG

AI总结 本研究提出金融原生智能体模型Mint-Agent,通过三大支柱开发出Mint-Cu(9B)和Mint-Ag(27B),在多个金融基准测试中展现出优异的可靠性与可执行性,为可信金融智能提供了新路径。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.17310 2026-08-24 cs.LG 版本更新 90%

Agentic ESOpt: Fine-Tuning Long-Horizon LLM Agents with Minimal GPU Requirements

Agentic ESOpt:以最小GPU资源微调长视野大语言模型智能体

Zhi Zheng, Rongsheng Chen, Yunpeng Ba, Zhenkun Wang, Yee Whye Teh, Wee Sun Lee

机构 * National University of Singapore(新加坡国立大学)

专题命中 规划决策 :agentic(title,title_cn);分类 cs.LG

AI总结 本文提出Agentic ESOpt框架,用进化策略微调长视野LLM智能体,仅需最小GPU资源,在WebArena-Lite上使Qwen-3.5-27B性能提升6.69%,提示-参数协同演化在多数设置中优于基准。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.20699 2026-08-24 cs.CV 新提交 85%

ArtiMo: Agent-Driven Articulated Mesh Animation

ArtiMo:智能体驱动的关节网格动画

Chunyu Zou, Peng Dai, Yi-Hua Huang, Ze Yuan, Jingwei Huang, Yeming Yao, Xiaojuan Qi

专题命中 规划决策 :agent(title,abstract);planning(abstract);agentic(abstract)

AI总结 ArtiMo是一种智能体驱动的零样本框架,结合URDF运动学约束与LLMs/VLMs,生成文本引导的关节网格动画,通过视觉自改进机制修正错误,在新基准数据集上优于基线。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.20405 2026-08-24 cs.CL 新提交 83%

ARGUS: Theory-of-Mind Guided Argument Generation with Strategy-Aware Planning and Knowledge Grounding

ARGUS:基于心理理论(Theory-of-Mind)的论证生成,结合策略感知规划与知识接地

Zhe Hu

机构 * InspireOmni AI The Hong Kong Polytechnic University(香港理工大学)

专题命中 规划决策 :planning(title,abstract);agent(abstract);分类 cs.CL

AI总结 该研究提出基于智能体的Argus框架,结合心理理论推理、策略感知规划等,在三个基准上优于基线,可有效改变抗拒受众立场。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.20372 2026-08-24 cs.IR cs.AI cs.MA 新提交 83%

Edge-Based Agentic Retrieval-Augmented Generation for Autonomous FHWA Bridge Inspection Compliance

面向美国联邦公路管理局(FHWA)桥梁检查合规性的基于边缘的智能体检索增强生成

Viraj Nishesh Darji, Hemaliben Rakeshkumar Darji

专题命中 规划决策 :agentic(title,abstract);planning(abstract);分类 cs.AI

AI总结 针对FHWA桥梁合规核查的痛点,提出离线智能体RAG系统BridgeGuard,结合向量搜索与SQL查询,在边缘硬件实现高准确率、高速的结构缺陷桥梁识别。

Comments 27 pages, 1 figure, 5 tables. Pre-print submitted to the ASCE Journal of Computing in Civil Engineering. Code and data available at: this https URL (https://github.com/virajdarji/bridgeguard)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.20481 2026-08-24 cs.CR cs.AI 新提交 81%

AEGIS: Preventing Cross-Domain Resource Abuse in MCP

AEGIS:防止MCP中的跨域资源滥用

Shriti Priya, Teryl Taylor, Frederico Araujo

专题命中 规划决策 :agent(summary_cn,abstract);分类 cs.AI

AI总结 本文提出AEGIS,该组件借助LLM将MCP工具调用归一化为统一表示,结合Open Policy Agent与ContextForge AI Gateway,可防止跨异构MCP工具和模态的资源滥用。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.15242 2026-08-24 cs.AI cs.SE 版本更新 81%

LongRCA Bench: Diagnosing Responsible Roles and Root Causes in Long-Horizon Agent Failures

LongRCA Bench:诊断长 horizon 智能体失败中的责任角色与根本原因

Yunfei Zhang, Boyu Feng, Changhua Pei, Zexin Wang, Zhihuang Peng, Xinlong Liu, Hengyue Jiang, Difeng Ma, Jiayi Zhang, Yongzhou Yao, Yanan Zhao, Fei Sun, Yintong Huo, Zhaoyang Liu, Jingjing Li, Gaogang Xie, Dan Pei

机构 * Computer Network Information Center, Chinese Academy of Sciences(中国科学院计算机网络信息中心) Hangzhou Institute for Advanced Study, University of Chinese Academy of Sciences(中国科学院大学杭州高等研究院) Chongqing University(重庆大学) Institute of Computing Technology, Chinese Academy of Sciences(中国科学院计算技术研究所) Singapore Management University(新加坡管理大学) Tongyi Lab, Alibaba Group(阿里巴巴集团通义实验室) Tsinghua University(清华大学)

专题命中 规划决策 :agent(title,abstract);分类 cs.AI、cs.SE

AI总结 LongRCA Bench 是含1140条失败轨迹的长 horizon 智能体失败诊断基准,本文提出无需训练的 RCTA 方法,在责任角色归因和根本步骤定位上优于现有基线,表明需将二者作为独立评估目标。

Comments 18 pages, 6 figures. Yunfei Zhang and Boyu Feng contributed equally. Changhua Pei is the corresponding author

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.21204 2026-08-24 cs.RO cs.LG 新提交 79%

Beyond Imitation: Self-Improving Robot Policies via Off-Policy Q-Planning

超越模仿:基于离线Q规划的机器人策略自改进

Varun Giridhar, Anant Khandelwal, Jeremy A. Collins, Ignat Georgiev, Animesh Garg

机构 * Georgia Institute of Technology(佐治亚理工学院)

专题命中 规划决策 :planning(title,abstract);分类 cs.LG

AI总结 该研究提出Q规划方法,为大型视觉运动BC策略配备离线Q函数,通过仅微调Q函数实现自改进,在仿真和真实机器人任务中均显著提升机器人操作性能,且优于多种对比方法。

Comments Project page with videos: this https URL (https://varungiridhar.github.io/qplanning/)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.21186 2026-08-24 cs.LG 新提交 79%

A Neurosymbolic Approach for Constructing Planning Domain Models from Clinical Narratives

一种从临床叙事构建规划领域模型的神经符号方法

Ranveer Singh, Saurabh Mathur, Michael Skinner, Prasad Tadepalli, Kristian Kersting, Sriraam Natarajan

专题命中 规划决策 :planning(title,abstract);分类 cs.LG

AI总结 针对临床叙事难以构建外科手术概率规划模型的问题,提出神经符号框架NSPIN,结合预训练LLM从2660份阑尾切除术记录生成的模型可泛化且符合临床实践。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.21157 2026-08-24 cs.DC cs.AI 新提交 79%

HIERA: Workload-Aware Planning Across Implementation Spaces for GPU Kernel Optimization

HIERA:面向GPU内核优化的跨实现空间工作负载感知规划

Jinghao Wang, Qiqi Gu, Chenpeng Wu, Jianguo Yao, Haibing Guan, Xijun Li

专题命中 规划决策 :planning(title,abstract);分类 cs.AI

AI总结 HIERA是一种跨实现空间的GPU内核优化分层规划框架,在KernelBench实验中优于无训练方法,还在科学计算模板算子上实现1.53倍加速,无需额外训练即可接近CUDA-L1性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.20510 2026-08-24 cs.AI 新提交 79%

A Temporal Planning Approach for Intelligent Flood Response

面向智能防洪响应的时序规划方法

Fazlul Hasan Siddiqui, Md. Monjurul Islam, Sabah Binte Noor

机构 * Dhaka University of Engineering & Technology(达卡工程技术大学) Bangladesh Army University of Engineering & Technology(孟加拉国陆军工程技术大学)

专题命中 规划决策 :planning(title,abstract);分类 cs.AI

AI总结 本研究提出一种智能防洪响应框架,利用时序规划技术建模防洪响应全生命周期,整合多类关键要素并支持执行中重规划,通过两种规划语言表述,实验验证其可行性与可扩展性并指导规划器选择。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.27204 2026-08-24 cs.CR cs.SE 版本更新 79%

MalSkills: Detecting Malicious Skills in the Agentic Supply Chain via Neuro-symbolic Reasoning

我的爱,华生。通过神经符号推理跨异构工件检测恶意技能

Shenao Wang, Junjie He, Yanjie Zhao, Yayi Wang, Kan Yu, Haoyu Wang

专题命中 规划决策 :agentic(title,abstract);分类 cs.SE

AI总结 本文提出MalSkills框架,通过符号解析与LLM语义分析提取异构工件中的安全敏感操作,构建技能依赖图并进行神经符号推理,实现恶意技能检测,实验表明其在F1得分上优于现有方法。

Comments Accepted by ASE 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.21013 2026-08-24 eess.SP 新提交 78%

Obstacle-Aware Online Receiver Planning in Multistatic Ranging

多站测距中的障碍物感知在线接收机规划

Jingwei Hu, Dave Zachariah, Petre Stoica, Torbjörn Wigren

专题命中 规划决策 :planning(title,abstract)

AI总结 针对多站测距中障碍物导致视距中断的问题,提出非近视后退时域框架,结合凸避障约束规划接收机轨迹,经数值实验验证其效率与跟踪精度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.21180 2026-08-24 eess.IV cs.CV 新提交 78%

Toward Vision Language Model-based Assessment of Clinical Quality and Usability of LGE-MR Images for Cardiac Ablation Planning

面向基于视觉语言模型的LGE-MR图像临床质量与可用性评估以用于心脏消融规划

Bipasha Kundu, Abhishek Chaturvedi, Axel W. E. Wismueller, Richard Simon, Cristian A. Linte

专题命中 规划决策 :planning(title,abstract)

AI总结 本研究提出两阶段VLM框架用于左心房LGE-MRI的临床导向图像质量评估,在60个图像切片-文本对数据集上,InternVL2的标准级准确率最高,DeepSeek实现完美临床可用性一致性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.21031 2026-08-24 cs.RO 新提交 78%

PhysCaP: Grounding Code-as-Policy Agent with Physics-Informed Exploration

PhysCaP:基于物理引导探索的代码即策略智能体

Chen-Yu Lin, Jing-Wen Chen, Hsueh-En Chang, Hung-An Chen, Sheng-Hsun Chang, Chi-Pin Huang, Fu-En Yang, Min-Hung Chen, Yi-Ting Chen, Yu-Chiang Frank Wang, Shao-Hua Sun

机构 * National Taiwan University(台湾大学) NVIDIA Research(英伟达研究院) National Yang Ming Chiao Tung University(国立阳明交通大学)

专题命中 规划决策 :agent(title,abstract)

AI总结 PhysCaP是一种带物理引导探索层的代码即策略智能体,采用双智能体设计,可高效估算物体物理属性,在桌面操纵及LIBERO模拟任务中性能优于基线方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.20946 2026-08-24 cs.RO 新提交 78%

Fast Coordinated Bimanual Motion Planning With Hard Constraints

带硬约束的快速双协作机械臂运动规划

Borna Paro, Luka Petrović, Ivan Marković

机构 * University of Zagreb(萨格勒布大学) Faculty of Electrical Engineering and Computing(电气工程与计算机学院)

专题命中 规划决策 :planning(title,abstract)

AI总结 针对双臂操作的相对变换硬约束问题,提出主从参数化的快速规划流水线,仿真中规划速度提升19.4倍,实际实验验证轨迹可直接迁移至硬件。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.16162 2026-08-24 cs.SD 版本更新 78%

ACE-Cap: Active Evidence Acquisition via Agentic Co-Evolution for Long-Paragraph Fine-Grained Audio Captioning

ACE-Cap:面向长段落细粒度音频字幕生成的智能体协同演化主动证据获取方法

Fengji Ma, Yan Rong, Xu Li, Xuenan Xu, Chen Zhang, Li Liu

机构 * Kling Team(Kling团队)

专题命中 规划决策 :agentic(title,abstract)

AI总结 ACE-Cap将长段落细粒度音频字幕生成转化为自适应主动证据获取过程,通过作曲器与指令模型协同演化及LOOP-GRPO算法优化,解决了传统模型被动生成的缺陷。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.20772 2026-08-24 cs.RO 版本更新 78%

Socially Consistent Multi-Robot Navigation Using Decoupled Planning and Trajectory Coordination

使用解耦规划和轨迹协调的社会一致多机器人导航

Matthew M. Sato, Kincho H. Law

专题命中 规划决策 :planning(title,abstract)

AI总结 研究多机器人在人类环境中的导航,通过解耦规划与轨迹协调,改进A*规划器嵌入社会规范构建社会图,转化轨迹协调为凸规划,实现可预测、符合社会规范的路径规划,简化多机器人协调。

Comments Accepted to Civil Engineering Sciences

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.20631 2026-08-24 cs.AI 新提交 77%

Weighted Memory Tree: Remembering What Matters for Long-Horizon LLM Agents

加权记忆树:为长视野大语言模型智能体记住重要信息

Quang Dao, Purvi Kathalkar, Kenneth Eaton

机构 * Rose-Hulman Institute of Technology(罗斯-霍曼理工学院) Georgia Institute of Technology(佐治亚理工学院) Georgia Tech Research Institute(佐治亚理工学院研究院)

专题命中 规划决策 :agent(abstract);tool use(abstract);planning(abstract);分类 cs.AI

AI总结 提出加权记忆树(WMT)分层记忆系统,在GAIA-Text数据集上使LLM智能体准确率平均提升9.97个百分点、令牌用量减32.8%,可抑制低效用内容与不可靠信息传播。

Comments 16 pages, 2 figures

详情

展开后加载摘要…

URL PDF HTML 收藏