arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

AI Agent

智能体、工具调用、规划、工作流、多智能体和自主任务执行。

共收录 93944 信号源:cs.AI, cs.CL, cs.LG, cs.SE

1. 工具调用 5130 篇

2602.05014 2026-02-13 cs.AI cs.CL cs.IR 86%

DeepRead: Document Structure-Aware Reasoning to Enhance Agentic Search

DeepRead: 一种基于文档结构的推理以增强代理搜索

Zhanli Li, Huiwen Tian, Lvzhou Luo, Yixuan Cao, Ping Luo

机构 * State Key Laboratory of AI Safety, Institute of Computing Technology, Chinese Academy of Sciences (CAS)(人工智能安全国家重点实验室,计算技术研究所,中国科学院) University of Chinese Academy of Sciences, CAS(中国科学院大学) Wenlan School of Business, Zhongnan University of Economics(中南财经政法大学文澜商学院)

专题命中 工具调用 :agentic(title,abstract);agent(abstract);tool-use(abstract);分类 cs.AI、cs.CL

AI总结 DeepRead通过结构感知的文档推理增强代理搜索,有效提升文档理解精度。

Comments This version has significantly enhanced the clarity of our research

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.08082 2026-02-10 cs.LG cs.AI eess.SP 86%

Spectral Guardrails for Agents in the Wild: Detecting Tool Use Hallucinations via Attention Topology

野生环境中代理的频谱护栏:通过注意力拓扑检测工具使用幻觉

Valentin Noël

机构 * Devoteam

专题命中 工具调用 :tool use(title,abstract);agent(abstract);autonomous agent(abstract);分类 cs.AI、cs.LG

AI总结 通过分析注意力拓扑谱,提出一种无需训练数据的防护方法,有效检测代理幻觉,揭示模型错误时注意力噪声特征。

Comments 32 pages, 2 fgures, 18 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.15075 2026-02-06 cs.AI cs.CL 86%

The Why Behind the Action: Unveiling Internal Drivers via Agentic Attribution

行动背后的缘由:通过代理归因揭示内部驱动因素

Chen Qian, Peng Wang, Dongrui Liu, Junyao Yang, Dadi Guo, Ling Tang, Jilin Mei, Qihan Ren, Shuai Shao, Yong Liu, Jie Fu, Jing Shao, Xia Hu

机构 * Shanghai Artificial Intelligence Laboratory(上海人工智能实验室) Renmin University of China(中国人民大学) National University of Singapore(新加坡国立大学)

专题命中 工具调用 :agentic(title,abstract);agent(abstract);tool use(abstract);分类 cs.AI、cs.CL

AI总结 本文提出通用代理归因框架,通过分层方法识别代理行为的内部驱动因素,提升代理系统的安全性和可问责性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.07631 2025-12-09 cs.AI cs.CC cs.IT cs.LG math.IT 86%

The Agent Capability Problem: Predicting Solvability Through Information-Theoretic Bounds

代理能力问题:通过信息论界限预测可解性

Shahar Lutati

机构 * Blavatnik School of Computer Science(布拉瓦特尼克计算机科学学院) Tel Aviv University(特拉维夫大学)

专题命中 工具调用 :agent(title,abstract);autonomous agent(abstract);agentic(abstract);分类 cs.AI、cs.LG

AI总结 本文提出代理能力问题框架,通过信息论界限预测代理解决任务的资源需求,结合主动学习、贝叶斯优化和强化学习原理,提升搜索效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.00271 2025-09-03 cs.AI cs.CL cs.IR 86%

MetaAgent: Toward Self-Evolving Agent via Tool Meta-Learning

Hongjin Qian, Zheng Liu

机构 * BAAI(北京人工智能研究院)

专题命中 工具调用 :agent(title);tool-use(abstract);workflow(abstract);agentic(abstract)

Comments Technical Report, 14 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.02584 2025-02-05 cs.LG cs.AI 86%

QLASS: Boosting Language Agent Inference via Q-Guided Stepwise Search

Zongyu Lin, Yao Tang, Xingcheng Yao, Da Yin, Ziniu Hu, Yizhou Sun, Kai-Wei Chang

机构 * University of California, Los Angeles(加利福尼亚大学洛杉矶分校)

专题命中 工具调用 :agent(title,abstract);workflow(abstract);agentic(abstract);分类 cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2409.00608 2024-10-28 cs.CL cs.LG 86%

TinyAgent: Function Calling at the Edge

Lutfi Eren Erdogan, Nicholas Lee, Siddharth Jha, Sehoon Kim, Ryan Tabrizi, Suhong Moon, Coleman Hooper, Gopala Anumanchipalli, Kurt Keutzer, Amir Gholami

专题命中 工具调用 :function calling(title,abstract);agent(abstract);agentic(abstract);分类 cs.CL、cs.LG

Comments EMNLP 2024 Demo

详情

展开后加载摘要…

URL PDF HTML 收藏
2408.02559 2024-08-06 cs.CL cs.AI 86%

Evaluating and Enhancing LLMs Agent based on Theory of Mind in Guandan: A Multi-Player Cooperative Game under Imperfect Information

Yauwai Yim, Chunkit Chan, Tianyu Shi, Zheye Deng, Wei Fan, Tianshi Zheng, Yangqiu Song

专题命中 工具调用 :agent(title,abstract);planning(abstract);multi-agent(abstract);分类 cs.AI、cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2404.04285 2024-04-09 cs.CL cs.AI 86%

MIMIR: A Streamlined Platform for Personalized Agent Tuning in Domain Expertise

Chunyuan Deng, Xiangru Tang, Yilun Zhao, Hanming Wang, Haoran Wang, Wangchunshu Zhou, Arman Cohan, Mark Gerstein

专题命中 工具调用 :agent(title,abstract);tool use(abstract);planning(abstract);分类 cs.AI、cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2401.13996 2024-01-26 cs.CL cs.AI 86%

Investigate-Consolidate-Exploit: A General Strategy for Inter-Task Agent Self-Evolution

Cheng Qian, Shihao Liang, Yujia Qin, Yining Ye, Xin Cong, Yankai Lin, Yesai Wu, Zhiyuan Liu, Maosong Sun

专题命中 工具调用 :agent(title,abstract);AI agent(abstract);planning(abstract);分类 cs.AI、cs.CL

Comments 18 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.26870 2026-05-27 cs.MA cs.AI cs.HC 86%

Persistent AI Agents in Academic Research: A Single-Investigator Implementation Case Study

学术研究中的持久性AI智能体:单研究者实施案例研究

Anas H. Alzahrani

机构 * Department of Preventive Medicine and Public Health, Faculty of Medicine, King Abdulaziz University(预防医学与公共卫生系,医学院,国王阿卜杜勒阿齐兹大学)

专题命中 工具调用 :AI agent(title);agentic(abstract,comments);agent(abstract);workflow(abstract)

AI总结 通过单研究者案例研究,分析了持久性AI智能体在真实学术环境中的架构、使用、产出和治理,发现缓存主导的工作流可能将经济单位从每token成本转向每完成工件成本。

Comments 19 pages, 2 figures, 3 main tables; supplementary appendix with 6 tables, 2 figures, and a reproducibility methods section. Describes 17 configured agents in a persistent research environment and introduces the PARE-M (Persistent Agentic Research Environment Measurement) framework

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.05271 2026-03-12 cs.CV cs.AI 86%

DeepEyesV2: Toward Agentic Multimodal Model

DeepEyesV2:迈向代理多模态模型

Jack Hong, Chenxiao Zhao, ChengLin Zhu, Weiheng Lu, Guohai Xu, Xing Yu

专题命中 工具调用 :agentic(title,abstract);tool use(abstract);tool-use(abstract);分类 cs.AI

AI总结 DeepEyesV2通过两阶段训练方法实现代理多模态模型,结合数据构建、训练优化和评估,提升现实世界推理与工具调用能力。

Comments Accepted to ICLR2026. Homepage: https://visual-agent.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.30251 2026-06-30 cs.MA 86%

TACO: Tool-Augmented Credit Optimization for Agentic Tool Use

TACO:面向智能体工具使用的工具增强信用优化

Mingkuan Feng, Jinyang Wu, Hao Gu, Fangrui Lv, Ruihan Jin, Chuyuan Zhang, Zhengqi Wen, Jianhua Tao

专题命中 工具调用 :agentic(title,abstract);tool use(title)

AI总结 提出TACO方法,通过差分答案探针奖励和结果门控优势路由,为代码工具智能体提供无监督工具贡献信用分配,提升多模态问答准确性并减少冗余工具调用。

详情

展开后加载摘要…

URL PDF HTML 收藏
2310.09470 2024-02-22 cs.RO 86%

Energy-Aware Ergodic Search: Continuous Exploration for Multi-Agent Systems with Battery Constraints

Adam Seewald, Cameron J. Lerch, Marvin Chancán, Aaron M. Dollar, Ian Abraham

专题命中 工具调用 :agent(title,abstract);multi-agent(title)

Comments 7 pages, 7 figures, ICRA'24

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.27439 2026-08-28 cs.CR cs.AI 新提交 85%

RedEvoAgent: Automatic Red-Teaming Agent with Experience-Driven Skill Evolution

RedEvoAgent:具备经验驱动技能演化的自动红队代理

Junjie Zhang, Hui Liu, Kecheng Chen, Xianbo Mo, Changsheng Chen, Haoliang Li

机构 * City University of Hong Kong(香港城市大学) Shenzhen MSU-BIT University(深圳北理莫斯科大学)

专题命中 工具调用 :agent(title,abstract);tool use(abstract);agentic(abstract);分类 cs.AI

AI总结 针对LLM代理的越狱攻击风险,提出RedEvoAgent黑盒红队代理,通过提炼攻击轨迹实现技能演化,在多基准实验中性能优于基线,工具效率更高且可迁移。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.21712 2026-08-27 cs.AI cs.MA 版本更新 85%

ATHENA: Knowledge-guided agentic neural architecture search for AutoFormer-based electronic health record modeling

ATHENA:面向基于AutoFormer的电子健康记录建模的知识引导型智能体神经架构搜索

Deyi Li, Qi Xu, Lingyao Li, Tiansheng Wang, Muxuan Liang, Mei Liu

机构 * University of Florida(佛罗里达大学) University of Arizona(亚利桑那大学) University of Houston(休斯顿大学) University of North Carolina at Chapel Hill(北卡罗来纳大学教堂山分校) University of Texas MD Anderson Cancer Center(德克萨斯大学MD安德森癌症中心)

专题命中 工具调用 :agentic(title,abstract);agent(abstract);multi-agent(abstract);分类 cs.AI

AI总结 本研究提出知识引导型智能体NAS框架ATHENA,通过跨医院复用架构知识,在6项临床预测任务的12项评估中9项优于或匹配基线方法,可减少Transformer型EHR建模的手动架构调整。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.22697 2026-08-25 cs.AI econ.GN q-fin.EC 新提交 85%

Does Rank Still Matter? Position Bias When AI Agents Shop on Our Behalf

排名仍然重要吗?AI代理代人购物时的位置偏差

Davood Wadi, Yu Ma

专题命中 工具调用 :AI agent(title,abstract);agent(abstract);agentic(abstract);分类 cs.AI

AI总结 该研究对比四种大语言模型与人类实地数据,发现AI代理代人购物时搜索深度更高、从不弃权,列表位置对其查看影响弱且非单调,结果属性比位置更重要,最终所有模型均选相同非劣势列表。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.20389 2026-08-24 cs.AI 新提交 85%

Representation Affects Retrieval: A Case Study of Skill Discovery and Routing in a Multimodal Agent Harness

表征影响检索:多模态智能体框架中技能发现与路由的案例研究

Kevin Dela Rosa

机构 * Cloudglue USA(美国Cloudglue公司)

专题命中 工具调用 :agent(title,abstract);workflow(abstract,abstract_cn);分类 cs.AI

AI总结 该研究以多模态智能体框架Tinycloud为案例,发现提示内技能的部分暴露会产生词汇竞争,抑制正确技能选择,其为大规模技能路由提供了小规模视角。

Comments 5 pages, 1 figure, 3 tables. Accepted at AgentSearch '26 workshop at SIGIR 2026 (Melbourne, Australia, July 24, 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.18613 2026-08-20 cs.AI cs.CR 新提交 85%

CTIFoundry: An Agent-Native Corpus Scaffold for Cyber Threat Intelligence

CTIFoundry:用于网络威胁情报的智能体原生语料库支架

Yutong Cheng, Changze Li, Qian Cui, Wei Ding, Lingzhi Wang, Yan Chen, Peng Gao

机构 * Virginia Tech(弗吉尼亚理工大学) Amazon(亚马逊公司) Northwestern University(西北大学)

专题命中 工具调用 :agent(title,abstract);planning(abstract);agentic(abstract);分类 cs.AI

AI总结 CTIFoundry是用于网络威胁情报的智能体原生语料库支架,在CTIConnect基准测试中可使智能体F1提升0.19至0.28,小型模型在其上表现优于旗舰模型,且无需增加搜索工作量。

Comments Preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.15881 2026-08-18 cs.LG cs.CE 新提交 85%

Deploying Frontier Agentic Technology in MOOSEnger, a Multiphysics-Capable AI Assistant

在多物理场AI助手MOOSEnger中部署前沿智能体技术

Zaid Abulawi, Mengnan Li, Guillaume Giudicelli, Yang Liu, Cody Permann

机构 * Texas A&M University (TAMU)(德克萨斯农工大学) Idaho National Laboratory (INL)(爱达荷国家实验室)

专题命中 工具调用 :agentic(title,abstract);agent(abstract);AI agent(abstract);分类 cs.LG

AI总结 本研究为面向MOOSE框架的AI智能体MOOSEnger扩展本地托管模型管控层,经多类工程任务测试,MOOSEnger-GPT-5.2成功率达90%,凸显智能体管控层对多物理场仿真的支撑价值。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.11977 2026-08-13 cs.AI 新提交 85%

Retry, Switch, or Abstain? Learning Strategy-Aware Tool-Use Policies via Controlled Error Injection

重试、切换还是弃权?通过受控错误注入学习策略感知的工具使用策略

Chaoran Chen, Vy Nguyen, Ziji Zhang, Abhinav Gullapalli, Ziyi Wang, Yuxuan Lu, Dakuo Wang, Jing Huang, Zhou Yu, Jin Lai

机构 * Amazon(亚马逊)

专题命中 工具调用 :tool-use(title,abstract);agent(abstract);tool use(abstract);分类 cs.AI

AI总结 该研究提出BENCH2ROBUST框架,结合BTM与课程强化学习,提升LLM智能体在工具故障下的稳健性,在零售任务中BTM可提稳健性16.8个百分点,二者结合达40.8-45.5%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.11888 2026-08-13 cs.AI 新提交 85%

Agent Skills Can Be Harmful: An Empirical Study of Skill-Induced Failures in LLM Agents

智能体技能可能有害:LLM智能体中技能诱导故障的实证研究

Gen Dong, Yanjie Gao, Liqun Li, Tianyin Xu, Yu Hua, Fan Yang

机构 * Huazhong University of Science and Technology(华中科技大学) Microsoft Research(微软研究院) Microsoft(微软) University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校)

专题命中 工具调用 :agent(title,abstract);tool use(abstract);planning(abstract);分类 cs.AI

AI总结 本文通过提出差异分析框架,在SkillsBench等数据集上发现LLM智能体的技能会引发功能故障与效率回归,并构建SkillTriage工具,为安全复用技能提供研究方向。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.10530 2026-08-12 cs.CR cs.AI 新提交 85%

On Understanding, Identifying, and Mitigating Vulnerabilities in Agentic Large Language Models

关于智能体大语言模型漏洞的理解、识别与缓解

Md Jafrin Hossain, Mohammad Arif Hossain, Nirwan Ansari

机构 * Florida International University(佛罗里达国际大学) Middle Tennessee State University(中田纳西州立大学) New Jersey Institute of Technology(新泽西理工学院)

专题命中 工具调用 :agentic(title,abstract);autonomous agent(abstract);planning(abstract);分类 cs.AI

AI总结 本研究针对智能体大语言模型安全开展系统文献综述,提出四层漏洞分类法,发现攻击研究多于防御研究、感知层漏洞研究占比偏高等现状,识别7个开放问题及架构耦合的核心不安全根源。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.08395 2026-08-11 econ.TH cs.AI cs.GT 新提交 85%

From Product Search to Preference Articulation: The Economics of Agentic Commerce

从产品搜索到偏好表达:智能体商业的经济学

Lingxiu Dong, Kaiwen Luo, Fasheng Xu

机构 * Olin Business School, Washington University in St. Louis(圣路易斯华盛顿大学奥林商学院) School of Business, University of Connecticut(康涅狄格大学商学院)

专题命中 工具调用 :agentic(title,abstract);agent(abstract);AI agent(abstract);分类 cs.AI

AI总结 该研究对比手动与智能体搜索,发现智能体搜索可避免手动搜索的崩溃,存在采用滞后现象,平台对注意力预算大的消费者会采用倒转的保真度分配,智能体商业核心转向偏好表达。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.08413 2026-08-11 cs.SE 新提交 85%

Tangent: An Empirical Study of Testing Practices for LLM-Based Agent Applications

Tangent:基于大语言模型的智能体应用测试实践的实证研究

Rangeet Pan, Tyler Stennett, Divya Sankar, Bridget McGinn, Alessandro Orso, Raju Pavuluri, Saurabh Sinha, Maja Vukovic

专题命中 工具调用 :agent(title,abstract);tool use(abstract);agentic(abstract);分类 cs.SE

AI总结 Tangent通过对开源项目和行业从业者的研究,分析了LLM智能体应用的测试现状,发现其以单元测试为主、存在覆盖不足等问题,并提出了相关研究方向。

Comments Accepted at ASE'26

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.05126 2026-08-06 cs.CL cs.MM 新提交 85%

Spoken Function Calling: A New Perspective on Spoken Language Understanding for Large Audio Language Models

语音函数调用:面向大型音频语言模型的语音理解新视角

Yuezhang Peng, Yuxin Liu, Changfeng Gao, Zhifu Gao, Xiangang Li, Xie Chen

机构 * Shanghai Jiao Tong University(上海交通大学) Token Foundry, Alibaba Group(阿里巴巴集团Token Foundry) Shanghai Innovation Institute(上海创新研究院)

专题命中 工具调用 :function calling(title,abstract);agent(abstract);multi-agent(abstract);分类 cs.CL

AI总结 该研究提出语音函数调用(SFC)这一新型语义理解视角,构建SFC-Bench数据集并评估LLMs与LALMs性能,经后训练提升LALMs的SFC能力,实验显示SFC优于传统SLU,可大幅提升语义提取准确率。

Comments ACM Multimedia 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.00218 2026-08-04 cs.CL 新提交 85%

A Few Neurons Reveal When LLMs Misuse Tools: Sparse Detection and Selective Steering for Reliable Tool Use

少量神经元可揭示大语言模型何时滥用工具:用于可靠工具使用的稀疏检测与选择性引导

Yutong Ke, Ming Yin, Chongwen Zhao, Kaizhu Huang

专题命中 工具调用 :tool use(title);agentic(abstract,abstract_cn);tool-use(abstract);分类 cs.CL

AI总结 本研究提出PRISMS框架,利用少量特定MLP神经元实现大语言模型工具使用故障的稀疏检测与选择性引导,可跨模型系列降低过度调用率、提升工具所需准确率。

Comments 21 pages, 4 figures. Includes supplementary material

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.25816 2026-07-29 cs.AI 新提交 85%

Speculate While You Reason: Teaching Agents to Predict Their Next Tool Call via Joint Agent-Speculator RL

推理时进行推测:通过联合智能体-推测器强化学习教智能体预测其下一个工具调用

Jiabao Ji, Yujian Liu, Li An, Rohit Jain, Gungor Polatkan, Siyu Zhu, Shiyu Chang

机构 * University of California, Santa Barbara(加利福尼亚大学圣巴巴拉分校) Linkedin Inc(领英公司)

专题命中 工具调用 :agent(title,abstract);tool-use(abstract);agentic(abstract);分类 cs.AI

AI总结 研究针对大型语言模型智能体等待工具调用结果时间长的问题,提出联合智能体-推测器强化学习方法,统一智能体和推测器为自推测智能体,复用缓存,提升了Qwen不同模型下一个工具调用的Hit@1指标及任务成功率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.23722 2026-07-28 cs.AI 新提交 85%

E-Bench: Benchmarking Multi-Step Tool-Use Agents in Real-World Product Scenarios

E-Bench:在现实世界产品场景中对多步工具使用智能体进行基准测试

Weihuang Zheng, Tianyuan Zou, Eileen Ye, Alphet Liu, Youyong Kong, Ya-Qin Zhang, Duran Zheng, Maxm Pan

机构 * Hunyuan Team, Tencent(腾讯混元团队) Institute for AI Industry Research, Tsinghua University(清华大学人工智能产业研究院) School of Computer Science and Engineering, Southeast University(东南大学计算机科学与工程学院)

专题命中 工具调用 :tool-use(title,abstract);agent(abstract);tool use(abstract);分类 cs.AI

AI总结 研究针对大语言模型多步工具使用能力,介绍E-Bench基准测试,通过解耦环境与任务合成构建可扩展可控测试平台,对11个前沿模型测试发现多步工具使用仍具挑战,即便结合代码执行可靠性也不高。

Comments 29 pages, 14 figures, 6 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.21461 2026-07-27 cs.AI 版本更新 85%

AREX: Towards a Recursively Self-Improving Agent for Deep Research

AREX:迈向深度研究的递归自我改进智能体

Shuqi Lu, Chaofan Li, Kun Luo, Zhang Zhang, Hui Wang, Hongwang Xiao, Lei Xiong, Jiahao Wang, Sen Wang, Xiyan Jiang, Wanli Li, Yuyang Hu, Hongjin Qian, Bingyu Yan, Jianlyu Chen, Ziyi Xia, Yingxia Shao, Kang Liu, Zhicheng Dou, Di He, Chaozhuo Li, Qiwei Ye, Zhongyuan Wang, Zheng Liu

机构 * Beijing Academy of Artificial Intelligence (BAAI)(北京通用人工智能研究院)

专题命中 工具调用 :agent(title,abstract);tool-use(abstract);agentic(abstract);分类 cs.AI

AI总结 该研究针对深度研究中发现与验证答案的不对称性,提出递归自我改进智能体AREX。它通过内部研究与外部自我改进循环交替工作,学习自主上下文更新工具,经训练后在多个基准测试中显著优于同等规模基线,与参数更多模型竞争。

详情

展开后加载摘要…

URL PDF HTML 收藏