arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

AI Agent

智能体、工具调用、规划、工作流、多智能体和自主任务执行。

2026-08-24 至 2026-08-24 共收录 11 信号源:cs.AI, cs.CL, cs.LG, cs.SE

1. 工具调用 11 篇

2608.20389 2026-08-24 cs.AI 新提交 85%

Representation Affects Retrieval: A Case Study of Skill Discovery and Routing in a Multimodal Agent Harness

表征影响检索:多模态智能体框架中技能发现与路由的案例研究

Kevin Dela Rosa

机构 * Cloudglue USA(美国Cloudglue公司)

专题命中 工具调用 :agent(title,abstract);workflow(abstract,abstract_cn);分类 cs.AI

AI总结 该研究以多模态智能体框架Tinycloud为案例,发现提示内技能的部分暴露会产生词汇竞争,抑制正确技能选择,其为大规模技能路由提供了小规模视角。

Comments 5 pages, 1 figure, 3 tables. Accepted at AgentSearch '26 workshop at SIGIR 2026 (Melbourne, Australia, July 24, 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.01444 2026-08-24 cs.AI cond-mat.mtrl-sci cs.CL cs.LG math.CT 版本更新 85%

Self-Revising Discovery Systems for Science: A Categorical Framework for Agentic Artificial Intelligence

科学中的自我修正发现系统:面向主体人工智能的范畴论框架

Fiona Y. Wang, Markus J. Buehler

机构 * Laboratory for Atomistic and Molecular Mechanics(原子分子力学实验室) Department of Biological Engineering(生物工程系) Massachusetts Institute of Technology(麻省理工学院) Department of Civil and Environmental Engineering(土木与环境工程系) Department of Mechanical Engineering(机械工程系) Center for Computational Science and Engineering(计算科学与工程中心) Schwarzman College of Computing(施瓦茨曼计算学院)

专题命中 工具调用 :agentic(title,abstract);workflow(abstract);分类 cs.AI、cs.CL、cs.LG

AI总结 本文提出一个基于范畴论的框架,通过左Kan扩展实现科学发现中的表征体制转换,并应用于材料科学中的蛋白质力学和纤维网络建模。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.04786 2026-08-24 cs.LG cs.AI 版本更新 84%

AgentOCR: Reimagining Agent History via Optical Self-Compression

AgentOCR: 通过光学自压缩重新想象代理历史

Lang Feng, Fuchao Yang, Feng Chen, Xin Cheng, Haiyang Xu, Zhenglin Wan, Ming Yan, Bo An

机构 * NTU(国立科技大学)

专题命中 工具调用 :agent(title,abstract);agentic(abstract);分类 cs.AI、cs.LG

AI总结 AgentOCR通过光学自压缩技术,将代理历史转换为紧凑图像,从而在保持性能的同时显著减少token消耗和内存使用。

Comments Work in progress

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.20771 2026-08-24 cs.AI 新提交 83%

CAS: Conformalized Agentic Search via Adaptive Retrieval and Policy Weighting

CAS:通过自适应检索与策略加权实现的保形智能体搜索

Zixi Zhu, Jiayuan Su, Jian Zhang, Yu Lin, Hongwei Wang

机构 * Zhejiang University(浙江大学) ZJU-UIUC Institute, Zhejiang University(浙江大学ZJU-UIUC学院) Tencent Inc.(腾讯公司)

专题命中 工具调用 :agentic(title,abstract);agent(abstract);分类 cs.AI

AI总结 本研究针对搜索智能体RL微调的可靠性问题,提出CAS框架,通过自适应检索与策略加权结合CP技术,提升推理准确率并减少冗余搜索,构建高可靠高效智能体范式。

Comments 21 pages, including figures, tables, and appendix

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.20844 2026-08-24 cs.AI 新提交 79%

TRACE: Agentic Catalog Enrichment with Multi-source Evidence Grounding

TRACE:基于多源证据锚定的智能体式商品目录丰富

Rohan Kumar, Steven Xu, Kyle MacDonald, Matthew Long, Bernice Chow, Mac VanRenterghem, Sudeep Das

机构 * DoorDash(多闸道科技(DoorDash))

专题命中 工具调用 :agentic(title,abstract);分类 cs.AI

AI总结 针对电商商品目录属性稀疏问题,提出基于LLM的TRACE框架,经离线评估、生产部署及在线实验验证,可高效提升目录属性丰富的准确率、覆盖率及结账转化率。

Comments 12 pages, 2 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.21126 2026-08-24 cs.CR 新提交 75%

TraceGrant: A Contract-Governed Security Framework for the Task-Effect Lifecycle of Networked LLM Agents

TraceGrant:一种用于联网LLM智能体任务-效应生命周期的合约治理安全框架

Bohao Liao, Jingchao Wang, Qipeng Song, Jin Cao, Jieling Wang, Boyu Deng

专题命中 工具调用 :agent(abstract,abstract_cn);tool use(abstract)

AI总结 TraceGrant是通过显式合约治理联网LLM智能体任务-效应生命周期的安全框架,在两类基准攻击案例中未出现攻击成功,且能关联用户意图、执行与任务完成。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.20658 2026-08-24 cs.CR cs.ET 新提交 71%

The Claws in Plain Sight: Unauthorized Context Disclosure through LLM Agent Tool Calls

显而易见的爪痕:通过大语言模型智能体工具调用实现未授权的上下文信息泄露

Ben Dong, Zhonghao Guo, Tianyi Lu, Qian Wang

专题命中 工具调用 :agent(title)

AI总结 该研究提出Claw in Plain Sight攻击方法,通过构造任务相关内容框架诱导LLM智能体泄露上下文信息,实验显示其在多种模型上的会话级泄露率达20.8%-75.0%,提示需在工具参数执行前进行目的与目的地感知检查。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.16824 2026-08-24 cs.LG cs.CR cs.IR 版本更新 70%

GEO-Flag: Detecting and Measuring GEO-Optimized Web Content

GEO-Flag:检测与测量经GEO优化的网页内容

Junjie Chu, Ye Leng, Mingjie Li, Yun Shen, Xinyue Shen, Yang Zhang

机构 * CISPA Helmholtz Center for Information Security(CISPA亥姆霍兹信息安全中心) HPE(慧与科技) University of Waterloo(滑铁卢大学)

专题命中 工具调用 :agent(abstract,abstract_cn);分类 cs.LG

AI总结 本研究针对生成式引擎优化(GEO)网页检测不足的问题,构建GEOFlagBench基准,提出干预配对训练(IPT)方法,开发GEO门控智能体系统,还部署流程测量出GEO总体流行率为8.90%。

Comments 23 pages, 8 figures, 23 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.21027 2026-08-24 cs.AI 新提交 57%

Don't Solve, Just Compare: Tiny Advisors for Runtime Intervention in LLM Agents

无需解决,仅需比较:用于LLM智能体运行时干预的微型顾问

Yanze Jiang, Mingxuan Li, Yuhao Wang, Shengfang Zhai, Jiaheng Zhang

机构 * National University of Singapore(新加坡国立大学)

专题命中 工具调用 :tool use(abstract);分类 cs.AI

AI总结 本研究针对LLM智能体运行时干预需求,提出仅比较框架COTA,经多任务多执行器评估,其性能优于基线,可在辅助模型能力弱于执行器时实现有效干预。

Comments 21 pages, 1 figure, Preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.11818 2026-08-24 cs.CV cs.AI 版本更新 57%

MM-ToolSandBox: A Unified Framework for Evaluating Visual Tool-Calling Agents

MM-ToolSandBox:一个用于评估视觉工具调用智能体的统一框架

Kaixin Ma, Di Feng, Alexander Metz, Jiarui Lu, Eshan Verma, Afshin Dehghan

机构 * Apple(苹果公司)

专题命中 工具调用 :planning(abstract);分类 cs.AI

AI总结 介绍MM-ToolSandBox框架,它能支持多图像、多轮任务,通过自动化管道生成场景。评估12个先进模型发现当前模型视觉工具调用能力不足,视觉精度是瓶颈,不同规模模型失败原因不同,该框架和基准已公开。

Comments Benchmark link: this https URL (https://github.com/apple/ml-mmtoolsandbox)

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.08875 2026-08-24 cs.AI cs.SI physics.soc-ph 版本更新 57%

Online design of dynamic networks

动态网络的在线设计

Duo Wang, Andrea Araldo, Mounim El Yacoubi

机构 * Peking University(北京大学) Institut Polytechnique de Paris(巴黎理工学院)

专题命中 工具调用 :planning(abstract);分类 cs.AI

AI总结 本文提出一种基于蒙特卡洛树搜索的滚动时间规划方法,用于动态网络的在线设计,通过实时调整公交线路以适应随机需求,提升系统性能。

Comments 14 pages

详情

展开后加载摘要…

URL PDF HTML 收藏