arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

AI Agent

智能体、工具调用、规划、工作流、多智能体和自主任务执行。

共收录 93944 信号源:cs.AI, cs.CL, cs.LG, cs.SE

1. 工具调用 5130 篇

2310.13065 2023-10-23 cs.RO cs.AI cs.LG 84%

Creative Robot Tool Use with Large Language Models

Mengdi Xu, Peide Huang, Wenhao Yu, Shiqi Liu, Xilun Zhang, Yaru Niu, Tingnan Zhang, Fei Xia, Jie Tan, Ding Zhao

专题命中 工具调用 :tool use(title,abstract);planning(abstract);分类 cs.AI、cs.LG

Comments 19 pages, 14 figures, 2 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.04444 2025-06-03 cs.AI 84%

Gödel Agent: A Self-Referential Agent Framework for Recursive Self-Improvement

Xunjian Yin, Xinyi Wang, Liangming Pan, Li Lin, Xiaojun Wan, William Yang Wang

机构 * Peking University(北京大学) University of California, Santa Barbara(加州大学圣巴巴拉分校) University of Arizona(亚利桑那大学)

专题命中 工具调用 :agent(title,abstract);agentic(abstract);分类 cs.AI

Comments ACL 2025 main. The code can be found at https://github.com/Arvid-pku/Godel_Agent

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.25624 2026-07-21 cs.CR cs.AI cs.CL cs.LG 版本更新 83%

STAC: When Innocent Tools Form Dangerous Chains for LLM Agents

STAC:当无害工具形成危险链以劫持LLM代理

Jing-Jing Li, Jianfeng He, Chao Shang, Devang Kulshreshtha, Xun Xian, Yi Zhang, Hang Su, Sandesh Swamy, Yanjun Qi

机构 * AWS AI Labs(AWS人工智能实验室) UC Berkeley(伯克利大学)

专题命中 工具调用 :agent(abstract);autonomous agent(abstract);tool use(abstract);tool-use(abstract)

AI总结 STAC通过多轮工具链攻击揭示LLM代理的安全漏洞,提出基于推理的防御策略,显著降低攻击成功率。

Comments Long version with 15 pages in main draft and a total of 39 pages including references and appendix. Data and code \url{https://github.com/amazon-science/MultiTurnAgentAttack}

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.15144 2025-12-29 cs.CR 83%

MCPZoo: A Large-Scale Dataset of Runnable Model Context Protocol Servers for AI Agent

MCPZoo:大规模可运行模型上下文协议服务器数据集用于AI代理

Mengying Wu, Pei Chen, Geng Hong, Baichao An, Jinsong Chen, Binwang Wan, Xudong Pan, Jiarun Dai, Min Yang

专题命中 工具调用 :agent(title);AI agent(title)

AI总结 MCPZoo是一个大规模可运行模型上下文协议服务器数据集,用于支持AI代理与外部工具交互的实证研究和安全分析

详情

展开后加载摘要…

URL PDF HTML 收藏
2406.19495 2024-07-01 cs.DM 83%

Multi-Agent Search-Type Problems on Polygons

Konstantinos Georgiou, Caleb Jones, Jesse Lucier

专题命中 工具调用 :agent(title);multi-agent(title)

详情

展开后加载摘要…

URL PDF HTML 收藏
2406.13161 2024-06-21 cs.AI cs.CL cs.LG cs.PL 83%

APPL: A Prompt Programming Language for Harmonious Integration of Programs and Large Language Model Prompts

Honghua Dong, Qidong Su, Yubo Gao, Zhaoyu Li, Yangjun Ruan, Gennady Pekhimenko, Chris J. Maddison, Xujie Si

专题命中 工具调用 :agent(abstract);tool use(abstract);workflow(abstract);multi-agent(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2305.00533 2023-05-02 cs.MA 83%

Guaranteed Evader Detection in Multi-Agent Search Tasks using Pincer Trajectories

Roee M. Francos, Alfred M. Bruckstein

专题命中 工具调用 :agent(title);multi-agent(title)

详情

展开后加载摘要…

URL PDF HTML 收藏
2004.08025 2021-09-01 cs.RO cs.MA 83%

STT-CBS: A Conflict-Based Search Algorithm for Multi-Agent Path Finding with Stochastic Travel Times

Oriana Peltzer, Kyle Brown, Mac Schwager, Mykel J. Kochenderfer, Martin Sehr

专题命中 工具调用 :agent(title);multi-agent(title)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.26623 2026-08-28 cs.AI 新提交 83%

AgentJudgeBench: A Multi-Difficulty Benchmark for Evaluating LLM Judges on Agentic Tool-Calling

AgentJudgeBench:用于评估智能体工具调用的多难度基准

Abhigya Verma, Amit Kumar Saha, Seganrasan Subramanian, Sai Harshitha Aluru

机构 * ServiceNow AI(ServiceNow人工智能部门)

专题命中 工具调用 :agentic(title,abstract);workflow(abstract);分类 cs.AI

AI总结 该研究提出AgentJudgeBench基准,评估LLM评判在智能体工具调用工作流上的可靠性,发现其对齐度随难度下降,真实值并非总有益,还给出了实用评估指南。

Comments 31 Pages, 9 Figures, 31 Tables, Accepted as a main conference paper at EMNLP 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.26563 2026-08-28 cs.CL 新提交 83%

SPT: Skills as Pre-Training Data for Agentic Language Models

SPT:将技能作为智能体语言模型的预训练数据

Yufei Sun, Yudong Li, Yiming Cheng

机构 * Beijing University of Posts and Telecommunications(北京邮电大学) Tsinghua University(清华大学)

专题命中 工具调用 :agentic(title,abstract);agent(abstract);分类 cs.CL

AI总结 本研究提出技能预训练(SPT)方法,将公开技能包作为训练数据,结合参考感知组装策略,可提升智能体语言模型的工具使用性能,同时保留通用性能,验证了技能包作为预训练数据源的价值。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.02357 2026-08-28 cs.CV cs.AI 版本更新 83%

Do Multimodal Agents Really Benefit from Tool Use? A Systematic Study of Capability Gains

多模态智能体真的从工具使用中受益吗?能力增益的系统性研究

Jiawei Guo, Donglei Yu, Yu Chen, Xiang Wang, Shuai Li, Xinpei Zhao, Huaxing Liu, Qinghao Wang, Minpeng Liao

专题命中 工具调用 :tool use(title);agent(abstract);tool-use(abstract);分类 cs.AI

AI总结 通过对比工具增强与无工具的多模态智能体在多项任务上的表现,发现工具使用并未带来一致的性能提升,智能体更多是学会了工具调用模式而非真正利用工具扩展能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.25559 2026-08-27 cs.CV cs.AI 新提交 83%

AdaVDR: Adaptive Tool Use and Reflection for Video Deep Research

AdaVDR:面向视频深度研究的自适应工具使用与反思

Xintong Zhang, Xiaomeng Fan, Shilin Yan, Ekko He, Zicheng Liu, Zijian Zou, Guannan Zhang, Yuwei Wu, Zhi Gao, Hongwei Xue

机构 * Alibaba Group(阿里巴巴集团) Beijing Institute of Technology(北京理工大学)

专题命中 工具调用 :tool use(title);agent(abstract);tool-use(abstract);分类 cs.AI

AI总结 提出AdaVDR自适应视频深度研究智能体,通过自适应工具调用与反思解决视频深度研究的不当工具调用等问题,构建相关基准并在VDR-EE、VideoDR上取得优于基础模型的效果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.20771 2026-08-24 cs.AI 新提交 83%

CAS: Conformalized Agentic Search via Adaptive Retrieval and Policy Weighting

CAS:通过自适应检索与策略加权实现的保形智能体搜索

Zixi Zhu, Jiayuan Su, Jian Zhang, Yu Lin, Hongwei Wang

机构 * Zhejiang University(浙江大学) ZJU-UIUC Institute, Zhejiang University(浙江大学ZJU-UIUC学院) Tencent Inc.(腾讯公司)

专题命中 工具调用 :agentic(title,abstract);agent(abstract);分类 cs.AI

AI总结 本研究针对搜索智能体RL微调的可靠性问题,提出CAS框架,通过自适应检索与策略加权结合CP技术,提升推理准确率并减少冗余搜索,构建高可靠高效智能体范式。

Comments 21 pages, including figures, tables, and appendix

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.04100 2026-08-20 cs.AI 版本更新 83%

Hybrid Reinforcement Learning and Search for Flight Trajectory Planning

混合强化学习与搜索的飞行轨迹规划

Alberto Luise, Michele Lombardi

专题命中 工具调用 :planning(title,abstract);agent(abstract);分类 cs.AI

AI总结 本文提出一种混合强化学习与搜索的方法,用于快速优化民航飞行路径,通过预计算近优路径减少求解空间,提升计算效率并保持燃油消耗相近。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.16370 2026-08-18 cs.AI 新提交 83%

What Does Context Compression Cost an Agent? Interaction Costs Unrevealed by Task-Completion Metrics

上下文压缩会给智能体带来什么代价?任务完成指标未揭示的交互代价

Shuyu Liu

机构 * Chongqing University of Science and Technology(重庆科技学院)

专题命中 工具调用 :agent(title,abstract);planning(abstract);分类 cs.AI

AI总结 该研究针对使用工具的智能体,发现上下文压缩会带来任务完成指标未揭示的隐藏交互成本,检索调用增加是其主要来源,且该特征具有环境依赖性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.16207 2026-08-18 cs.AI 新提交 83%

Competing at Every Price Point with Agentic Evolution over a Menu of LLMs

基于LLMs菜单的智能体进化,在每个价格点展开竞争

Andrew Borthwick

专题命中 工具调用 :agentic(title,abstract);agent(abstract);分类 cs.AI

AI总结 本研究提出进化元智能体RoboPhD,通过对含9个LLM端点的菜单进行智能体进化,在DS-1000和PaperFindingBench两个任务上,除一个位置外占据所有帕累托前沿槽位,实现各价格点的竞争优势。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.15145 2026-08-18 cs.AI 新提交 83%

ACTS-SQL: Agentic and Critic-Oriented Tree-Structured SQL Correctness with Large Language Models

ACTS-SQL:基于大型语言模型的面向智能体与评判器的树结构化SQL正确性校验

Xinmei Huang, Jie Song, Peng Li, Fuxin Jiang, Jing Zhang, Tieying Zhang, Jianjun Chen, Chenming Liu, Tao Yang, Maoyin Liu, Wenda Li, Hong Chen, Cuiping Li

机构 * Renmin University of China(中国人民大学) ByteDance Inc.(字节跳动公司)

专题命中 工具调用 :agentic(title,abstract);agent(abstract);分类 cs.AI

AI总结 本文提出无训练框架ACTS-SQL,将SQL修正建模为计划引导的树结构化调试过程,集成执行校验与诊断工具,在BIRD-Critic基准及火山引擎TLS生产环境中均实现显著准确率提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.15776 2026-08-18 cond-mat.mtrl-sci cs.AI 新提交 83%

ALKEMIE Agent: an autonomous platform for computational materials design

ALKEMIE智能体:用于计算材料设计的自主平台

Hongfu Huang, Yuzhe Li, Ao Xu, Bo Liu, Changrui Wang, Kan Tang, Ning Yang, Shengxian Liu, Hanyu Liu, Pengpeng Zhang, Linggang Zhu, Fengkai Liu, Yichen Lu, Tong Zhao, Naihua Miao, Jian Zhou, Zhimei Sun

专题命中 工具调用 :agent(title,abstract);agentic(abstract);分类 cs.AI

AI总结 该研究针对材料计算工作流程碎片化的问题,提出集成多种技术的ALKEMIE智能体平台,通过多种材料相关应用验证其能力,并展望了该类平台的未来发展方向与挑战。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.12888 2026-08-18 cs.CL 版本更新 83%

When Your Agent Opens the Chat App: Agent-Controlled Search over Raw Chat Logs Rivals Structured Memory

当你的智能体打开聊天应用时:智能体控制的原始聊天日志搜索可与结构化记忆相媲美

Ruizhe Li, Licheng Zhang, Benfeng Xu, Mingxuan Du, Zheren Fu, Weidong Chen

机构 * University of Science and Technology of China(中国科学技术大学) MetaStone Technology(MetaStone科技公司)

专题命中 工具调用 :agent(title,abstract);agentic(abstract);分类 cs.CL

AI总结 该研究提出无语义结构的智能体控制搜索界面ReFind,在MemoryAgentBench等任务上,其检索准确率优于HippoRAG 2等结构化记忆系统,证明可控词汇检索可替代复杂记忆结构实现高效会话记忆任务。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.06510 2026-08-18 cs.CY cs.AI cs.HC 版本更新 83%

Agentic AI: User Empowerment or Foreclosure?

智能体AI:用户赋能还是圈地?

David Gamba, Daniel M. Romero, Grant Schoenebeck

专题命中 工具调用 :agentic(title,abstract);分类 cs.AI

AI总结 本文通过分析广告拦截器等四个领域,指出智能体AI的治理决策本质是政治选择,其配置正被模型上下文协议等专有框架锁定,可能损害用户权益。

Comments Extended version of AIES'2026 publication

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.24496 2026-08-18 cs.CR cs.AI 版本更新 83%

Red-Teaming the Agentic Red-Team

红队测试代理型红队

Dario Pasquini, Michal Bazyli, Taras Fedynyshyn, Artem Sorokin

机构 * Cracken Information Protection Department, Lviv Polytechnic National University(利沃夫理工学院信息保护系)

专题命中 工具调用 :agentic(title,abstract);agent(abstract);分类 cs.AI

AI总结 本文首次深入分析主流进攻性安全代理系统的安全漏洞,揭示其设计缺陷可导致API密钥泄露、持久化控制及宿主机失陷,并提出架构级缓解设计原则。

Comments v0.1

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.10363 2026-08-14 cs.AI 版本更新 83%

Nutrition Data Infrastructure for the AI Era: Operationalizing FAIR for Agent-Mediated Research

AI时代的营养数据基础设施:为智能体介导的研究实现FAIR原则

Lin Liao, Peng Li

专题命中 工具调用 :agent(title,abstract);AI agent(abstract);分类 cs.AI

AI总结 该研究针对AI智能体介导营养研究的数据歧义问题,提出NDS基础设施,实现FAIR原则,在基准测试中表现优于现有模型,保障分析可复现,为相关研究提供新型数据支撑。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.12282 2026-08-13 cs.AI 新提交 83%

VAKRA: Evaluating Multi-Hop Reasoning Across APIs and Retrieval Under Tool-Use Policies

VAKRA:评估工具使用策略下跨API与检索的多跳推理能力

Ankita Rajaram Naik, Anupama Murthi, Benjamin Elder, Siyu Huo, Raavi Gupta, Abhinav Jain, Praveen Venkateswaran, Abdulhamid Adebayo, Danish Contractor

机构 * IBM(国际商业机器公司(IBM))

专题命中 工具调用 :tool-use(title,abstract);agent(abstract);分类 cs.AI

AI总结 本研究推出VAKRA基准评估工具使用策略下跨API与检索的多跳推理,发现现有最优模型在相关任务上性能随推理深度显著下降,失败集中于语言介导推理环节。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.00316 2026-08-13 cs.LG stat.ML 版本更新 83%

Agentic Bayesian Optimization through Surrogate-Augmented Autoresearch

基于代理的贝叶斯优化:通过代理增强的自动研究

Paul Brunzema, Louis Tiao, Nhat Le, Kevin De Angeli, Yao Xuan, Djordje Gligorijevic

机构 * Meta RWTH Aachen University(亚琛工业大学)

专题命中 工具调用 :agentic(title,abstract);agent(abstract);分类 cs.LG

AI总结 该研究提出代理式贝叶斯优化范式,构建Sara代理与lenz后端,在合成及真实基准测试中,其兼具可靠性与性能,还可动态重构优化问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.10039 2026-08-12 cs.LG 新提交 83%

FlowScout: From Execution Feedback to Reliable Tool-Using Agent Workflows

FlowScout:从执行反馈到可靠的工具使用智能体工作流

Shuo Hao, You Lu, Bihuan Chen, Xin Peng

专题命中 工具调用 :agent(title);workflow(abstract);agentic(abstract);分类 cs.LG

AI总结 FlowScout是从历史任务记录生成工具集成型智能体工作流的执行引导框架,经多任务域评估,其工具调用正确性与执行质量均显著优于PM4Py等基线方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.01344 2026-08-11 cs.AI 版本更新 83%

Agentic Stage-One Stellarator Optimization: Autonomous Multi-Objective Search for Finite-Beta Equilibria

智能体阶段一仿星器优化:有限β平衡的自主多目标搜索

Tingjia Zhang, Zhuoran Meng, Runlai Xu

专题命中 工具调用 :agentic(title,abstract);agent(abstract);分类 cs.AI

AI总结 本文提出智能体阶段一仿星器优化概念,通过语言模型智能体与DESC执行配合,提升有限β平衡构型的质量与数量,生成结构化决策数据,实现可扩展的多目标优化。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.06270 2026-08-07 cs.AI 新提交 83%

The Illusion of Visual Tool-Use: A Causal Audit of Thinking with Images

视觉工具使用的错觉:对图像思考的因果审查

Zhiheng Wang, Bo Peng, Lai Wei, Chaochao Lu

机构 * Shanghai Artificial Intelligence Laboratory(上海人工智能实验室) Shanghai Jiao Tong University(上海交通大学) Shanghai Innovation Institute(上海创新研究院)

专题命中 工具调用 :tool-use(title,abstract);planning(abstract);分类 cs.AI

AI总结 本文通过因果审查方法,发现多模态大语言模型的视觉工具使用存在“调用而不查看”“查看而不规划”等错觉,整体准确率增益下大量场景无因果效果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.05359 2026-08-07 cs.AI 新提交 83%

CASCADE: An Agentic Regulatory Network Framework for Patient-Data-Validated Downstream Perturbation Prediction

CASCADE:一种用于经患者数据验证的下游扰动预测的智能体调控网络框架

Jose A. Bird

专题命中 工具调用 :agentic(title,abstract);agent(abstract);分类 cs.AI

AI总结 该研究提出CASCADE智能体调控网络框架,基于ARACNe网络预测基因扰动下游转录效应,通过TCGA、METABRIC数据验证其MYC基因预测方向的准确性,还评估LLM智能体映射自然语言请求至MCP工具调用的表现,发现其在模糊查询时存在错误选择扰动类型的问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.21806 2026-08-07 cs.SE 版本更新 83%

Where Agent Frameworks Fall Short: Examining Functional Challenges and Usability Concerns

对现代LLM代理框架中缺陷的实证研究

Xinxue Zhu, Yanzhou Mu, Xiaoyu Zhang, Tianlin Li, Chao Shen, Chunrong Fang, Yang Liu, Juan Zhai

专题命中 工具调用 :agent(title,abstract);workflow(abstract);分类 cs.SE

AI总结 本文通过分析998个缺陷报告,发现现代LLM代理框架中缺陷主要源于API误用、不兼容和文档不同步,集中在自我行动阶段,导致功能错误、崩溃和构建失败。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.20244 2026-08-05 cs.LO cs.AI cs.CL cs.LG cs.SE 版本更新 83%

Lean Refactor: Multi-Objective Controllable Proof Optimization via Agentic Strategy Search

Lean Refactor: 通过代理策略搜索实现多目标可控的证明优化

Jialin Lu, Soonho Kong, Rodrigo Stehling, Kaiyu Yang, Zhangyang Wang, Weiran Sun, Wuyang Chen

机构 * Simon Fraser University(西蒙弗雷泽大学) Amazon Web Services(亚马逊网络服务) MiroMind University of Texas at Austin(德克萨斯大学奥斯汀分校)

专题命中 工具调用 :agentic(title,abstract);分类 cs.AI、cs.CL、cs.LG

AI总结 本文提出Lean Refactor框架,通过检索增强的代理策略搜索,解决多目标、可控和版本鲁棒的Lean证明重构问题,主要贡献是通过预注释的多目标重构策略数据库实现高效的证明优化。

详情

展开后加载摘要…

URL PDF HTML 收藏