arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

AI Agent

智能体、工具调用、规划、工作流、多智能体和自主任务执行。

共收录 93944 信号源:cs.AI, cs.CL, cs.LG, cs.SE

1. 工具调用 5130 篇

2608.01388 2026-08-04 cs.CR cs.AI cs.LG 新提交 76%

Why Formal Monitors Fail: Attack Distribution Entropy as a Coverage Bound for LTL-Based LLM Agent Safety

形式化监视器为何失效:攻击分布熵作为基于LTL的LLM智能体安全的覆盖边界

Ruiyang Zhang

机构 * Ryonix Labs Inc.(Ryonix实验室公司)

专题命中 工具调用 :agent(title);分类 cs.AI、cs.LG

AI总结 该研究揭示基于LTL的LLM智能体安全监视器覆盖差异源于攻击分布熵,提出熵-覆盖边界并验证,引入部署前熵测试,可预测监视器覆盖并支持架构感知选择。

Comments 6 pages, 1 figure. Accepted at the 13th IEEE International Conference on Intelligent Systems (IS'26), Varna, Bulgaria, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2404.01549 2026-07-21 cs.CL cs.SE 版本更新 76%

Octopus: On-device language model for function calling of software APIs

章鱼:用于软件API函数调用的设备端语言模型

Wei Chen, Zhiyuan Li, Mingyuan Ma

机构 * Stanford University(斯坦福大学) Harvard University(哈佛大学)

专题命中 工具调用 :function calling(title);分类 cs.CL、cs.SE

AI总结 研究利用设备端大语言模型调用软件API,通过编译数据集微调不同参数模型,提升其API交互能力,提出条件掩码技术和新基准,经微调的Octopus模型在API调用上性能超GPT-4,推动自动化软件开发和API集成。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.14494 2026-07-17 cs.AI cs.IR cs.LG 新提交 76%

SAGA: Schema-Aware Grounding for Agentic Text-to-SPARQL Generation

SAGA:用于智能文本到SPARQL生成的模式感知基础

Yiming Zhang, Koji Tsuda

专题命中 工具调用 :agentic(title);分类 cs.AI、cs.LG

AI总结 研究复杂知识库问答中语义解析范式,针对现有智能体类型盲基础问题,提出无训练框架SAGA,通过模式约束基础操作,维护类型状态,过滤候选属性,以紧凑格式呈现图模式,在多基准设置上取得优异成绩。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.05728 2026-06-05 cs.AI cs.CL 76%

DiG-Plan: Mitigating Early Commitment for Tool-Graph Planning via Diffusion Guidance

DiG-Plan:通过扩散引导缓解工具图规划中的早期承诺问题

Yansi Li, Zhuosheng Zhang

机构 * School of Computer Science, Shanghai Jiao Tong University(上海交通大学计算机科学学院)

专题命中 工具调用 :planning(title);分类 cs.AI、cs.CL

AI总结 针对工具图规划中自回归解码的早期承诺问题,提出基于扩散生成器与自回归精炼器解耦的DiG-Plan框架,显著提升组合搜索覆盖率和任务性能。

Comments Accepted at IJCAI-ECAI 2026. This is an author preprint; the final version will appear in the IJCAI Proceedings

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.28000 2026-05-28 cs.SE cs.AI 76%

Tool Forge: A Validation-Carrying Toolchain for Governed Agentic Execution

Tool Forge:一种用于受控代理执行的携带验证的工具链

Swanand Rao

机构 * Next Moca Global, Inc.(Next Moca全球公司)

专题命中 工具调用 :agentic(title);分类 cs.AI、cs.SE

AI总结 本文提出 Tool Forge,一种将自然语言能力意图转换为经过验证、沙盒验证、编目工具制品,并通过令牌高效路由层暴露给代理的工具链,解决了代理执行中工具层缺乏治理和验证的问题。

Comments 9 pages, 2 figures, 3 tables. Code: https://github.com/nextmoca/tool-forge

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.24943 2026-03-27 cs.AI cs.CL 76%

FinMCP-Bench: Benchmarking LLM Agents for Real-World Financial Tool Use under the Model Context Protocol

FinMCP-Bench:基于模型上下文协议的LLM代理在真实金融工具使用中的基准测试

Jie Zhu, Yimin Tian, Boyang Li, Kehao Wu, Zhongzhi Liang, Junhui Li, Xianyin Zhang, Lifan Guo, Feng Chen, Yong Liu, Chi Zhang

机构 * Qwen DianJin Team, Alibaba Cloud Computing(阿里云云计算千问点睛团队) YINGMI Wealth Management(盈米财富管理) Soochow University(苏州大学)

专题命中 工具调用 :tool use(title);分类 cs.AI、cs.CL

AI总结 本文提出FinMCP-Bench,用于评估LLM在解决真实金融问题时通过调用金融模型上下文协议的能力,包含613个样本,涵盖10种主要场景和33种子场景,提供真实和合成查询,评估不同任务复杂度下的模型表现。

Comments Accepted by ICASSP 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.14146 2025-11-06 cs.AI cs.CL 76%

s3: You Don't Need That Much Data to Train a Search Agent via RL

Pengcheng Jiang, Xueqiang Xu, Jiacheng Lin, Jinfeng Xiao, Zifeng Wang, Jimeng Sun, Jiawei Han

机构 * University of Illinois Urbana Champaign(伊利诺伊大学厄巴纳-香槟分校) Amazon(亚马逊公司)

专题命中 工具调用 :agent(title);分类 cs.AI、cs.CL

Comments EMNLP 2025 camera-ready

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.04535 2025-09-23 cs.CL cs.AI 76%

Meta-Reasoning Improves Tool Use in Large Language Models

Lisa Alazraki, Marek Rei

机构 * Imperial College London(伦敦帝国学院)

专题命中 工具调用 :tool use(title);分类 cs.AI、cs.CL

Comments NAACL 2025 Findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.21071 2025-06-27 cs.LG cs.CL 76%

Enhancing LLM Tool Use with High-quality Instruction Data from Knowledge Graph

Jingwei Wang, Zai Zhang, Hao Qian, Chunjing Gan, Binbin Hu, Ziqi Liu, Zhiqiang Zhang, Jun Zhou, Bin Shi, Bo Dong

机构 * Ant Group, China(蚂蚁集团) School of Computer Science and Technology, Xi’an Jiaotong University, China(西安交通大学计算机科学与技术学院) School of Distance Education, Xi’an Jiaotong University, China(西安交通大学继续教育学院)

专题命中 工具调用 :tool use(title);分类 cs.CL、cs.LG

Comments 20 pages, 12 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.01940 2025-06-12 cs.CL cs.AI 76%

AskToAct: Enhancing LLMs Tool Use via Self-Correcting Clarification

Xuan Zhang, Yongliang Shen, Zhe Zheng, Linjuan Wu, Wenqi Zhang, Yuchen Yan, Qiuying Peng, Jun Wang, Weiming Lu

机构 * Zhejiang University(浙江大学) OPPO Research Institute(OPPO研究院)

专题命中 工具调用 :tool use(title);分类 cs.AI、cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2403.14562 2025-04-30 cs.CL cs.AI cs.HC cs.MA 76%

Agentic AI: The Era of Semantic Decoding

Maxime Peyrard, Martin Josifoski, Robert West

机构 * Univ. Grenoble Alpes, CNRS, Grenoble INP, LIG EPFL(格勒诺布尔阿尔卑斯大学、国家科学研究中心、格勒诺布尔INP、LIG EPFL)

专题命中 工具调用 :agentic(title);分类 cs.AI、cs.CL

Comments 25 pages, 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.05255 2025-04-25 cs.SE cs.CL 76%

CallNavi, A Challenge and Empirical Study on LLM Function Calling and Routing

Yewei Song, Xunzhu Tang, Cedric Lothritz, Saad Ezzini, Jacques Klein, Tegawendé F. Bissyandé, Andrey Boytsov, Ulrick Ble, Anne Goujon

机构 * University of Luxembourg(卢森堡大学) Luxembourg Institute of Science and Technology(卢森堡科学与技术研究所) Department of Information and Computer Science(信息与计算机科学系) BGL BNP PARIBAS Interdisciplinary Research Center for Intelligent Manufacturing and Robotics(智能制造与机器人跨学科研究中心)

专题命中 工具调用 :function calling(title);分类 cs.CL、cs.SE

Journal ref The 29th International Conference on Evaluation and Assessment in Software Engineering (EASE 2025)

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.12094 2025-02-18 cs.AI cs.CL 76%

A Study on Leveraging Search and Self-Feedback for Agent Reasoning

Karthikeyan K, Michelle Yuan, Elman Mansimov, Katerina Margatina, Anurag Pratik, Daniele Bonadiman, Monica Sunkara, Yi Zhang, Yassine Benajiba

机构 * Duke University(杜克大学) Amazon Web Services(亚马逊网络服务)

专题命中 工具调用 :agent(title);分类 cs.AI、cs.CL

Comments Under review

详情

展开后加载摘要…

URL PDF HTML 收藏
2306.08129 2023-11-03 cs.CV cs.AI cs.CL 76%

AVIS: Autonomous Visual Information Seeking with Large Language Model Agent

Ziniu Hu, Ahmet Iscen, Chen Sun, Kai-Wei Chang, Yizhou Sun, David A Ross, Cordelia Schmid, Alireza Fathi

专题命中 工具调用 :agent(title);分类 cs.AI、cs.CL

Comments Published on NeurIPS 2023

详情

展开后加载摘要…

URL PDF HTML 收藏
2306.11301 2023-10-24 cs.LG cs.AI cs.RO 76%

Adversarial Search and Tracking with Multiagent Reinforcement Learning in Sparsely Observable Environment

Zixuan Wu, Sean Ye, Manisha Natarajan, Letian Chen, Rohan Paleja, Matthew C. Gombolay

专题命中 工具调用 :agent(abstract,comments);multi-agent(abstract,comments);分类 cs.AI、cs.LG

Comments Accepted by IEEE International Symposium on Multi-Robot & Multi-Agent Systems (MRS) 2023

详情

展开后加载摘要…

URL PDF HTML 收藏
2306.13484 2023-06-26 cs.AI cs.LG 76%

Adaptive Planning Search Algorithm for Analog Circuit Verification

Cristian Manolache, Cristina Andronache, Alexandru Caranica, Horia Cucu, Andi Buzo, Cristian Diaconu, Georg Pelz

专题命中 工具调用 :planning(title);分类 cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2212.05742 2022-12-13 cs.LG cs.AI cs.MA cs.SY eess.SY 76%

Where to go: Agent Guidance with Deep Reinforcement Learning in A City-Scale Online Ride-Hailing Service

Jiyao Li, Vicki H. Allan

专题命中 工具调用 :agent(title);分类 cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2207.00475 2022-07-04 cs.CV cs.AI cs.LG eess.IV 76%

Agent with Tangent-based Formulation and Anatomical Perception for Standard Plane Localization in 3D Ultrasound

Yuxin Zou, Haoran Dou, Yuhao Huang, Xin Yang, Jikuan Qian, Chaojiong Zhen, Xiaodan Ji, Nishant Ravikumar, Guoqiang Chen, Weijun Huang, Alejandro F. Frangi, Dong Ni

专题命中 工具调用 :agent(title);分类 cs.AI、cs.LG

Comments Accepted by MICCAI 2022

详情

展开后加载摘要…

URL PDF HTML 收藏
2010.03599 2021-11-04 cs.LG cs.AI 76%

Improved POMDP Tree Search Planning with Prioritized Action Branching

John Mern, Anil Yildiz, Larry Bush, Tapan Mukerji, Mykel J. Kochenderfer

专题命中 工具调用 :planning(title);分类 cs.AI、cs.LG

Comments 7 pages

Journal ref AAAI-21 Technical Tracks Vol. 35, No. 13, 2021, 11888-11894

详情

展开后加载摘要…

URL PDF HTML 收藏
2005.11335 2020-05-26 cs.LG cs.AI 76%

Single-Agent Optimization Through Policy Iteration Using Monte-Carlo Tree Search

Arta Seify, Michael Buro

专题命中 工具调用 :agent(title);分类 cs.AI、cs.LG

Comments Poster presentation at RL in Games Workshop, AAAI 2020

详情

展开后加载摘要…

URL PDF HTML 收藏
1810.11954 2018-11-22 cs.CL cs.AI 76%

A Knowledge-Grounded Multimodal Search-Based Conversational Agent

Shubham Agarwal, Ondrej Dusek, Ioannis Konstas, Verena Rieser

专题命中 工具调用 :agent(title);分类 cs.AI、cs.CL

Journal ref Proceedings of the 2018 EMNLP Workshop SCAI: The 2nd International Workshop on Search-Oriented Conversational AI, pages 59-66, Brussels, Belgium, October 2018

详情

展开后加载摘要…

URL PDF HTML 收藏
1702.00020 2017-02-02 cs.AI cs.LG physics.chem-ph 76%

Towards "AlphaChem": Chemical Synthesis Planning with Tree Search and Deep Neural Network Policies

Marwin Segler, Mike Preuß, Mark P. Waller

专题命中 工具调用 :planning(title);分类 cs.AI、cs.LG

Comments 4 pages, 1 figure

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.08010 2026-08-26 cs.CL cs.LG cs.SE 版本更新 75%

Tool-Making and Self-Evolving LLM Agents in Low-Latency Systems

低延迟系统中的工具制作与自我进化大语言模型智能体

Kalle Kujanpää, Ning Liu, Shahnawaz Alam, Yeshwanth Reddy Sura, Tianyu Yang, Kristina Klinkner, Shervin Malmasi

机构 * Amazon(亚马逊)

专题命中 工具调用 :agent(abstract);agentic(abstract);分类 cs.CL、cs.LG、cs.SE

AI总结 研究如何解决生产LLM智能体因重复生成代码浪费延迟和可靠性的问题,提出用智能工具制作管道取代推理时编码循环,部署该方法使系统更快、更可靠、易操作,降低延迟和错误率,提高可审计性。

Comments To appear at EMNLP 2026 Industry Track

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.21126 2026-08-24 cs.CR 新提交 75%

TraceGrant: A Contract-Governed Security Framework for the Task-Effect Lifecycle of Networked LLM Agents

TraceGrant:一种用于联网LLM智能体任务-效应生命周期的合约治理安全框架

Bohao Liao, Jingchao Wang, Qipeng Song, Jin Cao, Jieling Wang, Boyu Deng

专题命中 工具调用 :agent(abstract,abstract_cn);tool use(abstract)

AI总结 TraceGrant是通过显式合约治理联网LLM智能体任务-效应生命周期的安全框架,在两类基准攻击案例中未出现攻击成功,且能关联用户意图、执行与任务完成。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.19303 2026-08-21 cs.AI cs.CL cs.SE 新提交 75%

Outcome Monitors: Recovery Affordances for Silent Tool Failures

结果监控器:针对静默工具故障的恢复可行性

Sugam Panthi, Rabab Abdelfattah

专题命中 工具调用 :agent(abstract,abstract_cn);分类 cs.AI、cs.CL、cs.SE

AI总结 该研究针对智能体决策中的静默工具故障问题,提出结果监控器方法,可检测结果契约违反并提供恢复工具,显著提升ToolMaze和tau-bench任务的完成率。

Comments 16 pages (9 main + 7 pages supplementary material), 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.13653 2026-07-28 cs.CV cs.RO 版本更新 75%

Exploratory, Communicative, and Deployable: Vision-Driven Embodied Agents for Open-World Mobile Manipulation

探索性、交流性和可部署性:用于开放世界移动操作的视觉驱动具身智能体

Boyu Mi, Mengchen Ma, Yifei Yao, Xing Gao, Junting Chen, Yangzi Li, Zihou Zhu, Guohao Li, Zhenfei Yin, Tai Wang, Yao Mu, Jiangmiao Pang, Hanqing Wang

专题命中 工具调用 :agent(abstract);tool-use(abstract);agentic(abstract)

AI总结 研究针对具身智能体现实部署难题,提出REAL框架,通过建立一致环境API、设计任务组合优化性能,引入REAL - Bench评估。实验显示其智能体在交互式任务中表现出色,在物理机器人上也实现高成功率,弥合现实差距。

Comments Accepted to ECCV 2026. 57 pages. Code available at https://github.com/InternRobotics/REAL

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.21361 2026-07-24 cs.MA 新提交 75%

FedAgentKE: Federated Semantic Knowledge Evolution for Heterogeneous Agents

FedAgentKE:异构智能体的联邦语义知识演化

Weihao Li, Jun Bai, Ziyang Song

专题命中 工具调用 :agent(abstract);tool use(abstract);workflow(abstract)

AI总结 研究异构智能体孤立运行问题,提出 FedAgentKE 框架,通过语义知识蒸馏、聚合和Adapt实现联邦语义知识演化,实验验证其在跨框架和跨任务设置下能改进智能体协作,为未来协作智能体生态系统发展提供潜力。

Comments 9 pages (including appendix)

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.14108 2026-07-17 cs.CL cs.AI cs.SE 新提交 75%

Eta Given Delta: Defining LLM Tool Efficiency With Marginal Tool Utility

给定增量的埃塔:用边际工具效用定义大语言模型工具效率

Nyx Iskandar

机构 * Foam(泡沫)

专题命中 工具调用 :agent(abstract);tool use(abstract);分类 cs.AI、cs.CL、cs.SE

AI总结 研究提出用于评估LLM智能体轨迹中工具调用率的工具效率及边际工具效用指标,用LLM-as-a-Judge确定边际工具效用符号,区别于间接测效率的 prior work,直接测效率,为LLM评估研究及相关工程做贡献。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.02345 2026-07-03 cs.SE cs.AI cs.CL 新提交 75%

SkillFuzz: Fuzzing Skill Composition for Implicit Intents Discovery in Open Skill Marketplaces

SkillFuzz: 面向开放技能市场中隐式意图发现的技能组合模糊测试

Jinwei Hu, Yi Dong, Youcheng Sun, Xiaowei Huang

机构 * School of Computer Science and Informatics, University of Liverpool(利物浦大学计算机科学与信息学学院) Mohamed bin Zayed University of Artificial Intelligence(穆罕默德·本·扎耶德人工智能大学)

专题命中 工具调用 :agent(abstract);planning(abstract);分类 cs.AI、cs.CL、cs.SE

AI总结 提出SkillFuzz,首个无需执行的模糊测试方法,通过提取结构化技能契约并利用契约引导的蒙特卡洛树搜索,在开放技能市场中高效发现因技能组合导致的隐式意图,验证了80%以上高风险组合。

Comments Under Review

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.01972 2026-07-03 cs.CL cs.AI cs.LG 新提交 75%

Object Aligner: A Configurable JSON Schema Similarity Score for Graphs, Applied to LLM Prompt Optimization

Object Aligner: 一种可配置的图结构JSON模式相似度评分,应用于LLM提示优化

Jan Drchal

机构 * Artificial Intelligence Center, Faculty of Electrical Engineering, Czech Technical University in Prague(捷克理工大学电气工程学院人工智能中心)

专题命中 工具调用 :planning(abstract);agentic(abstract);分类 cs.AI、cs.CL、cs.LG

AI总结 提出Object Aligner,一种基于递归树对齐和引用对齐的JSON相似度评分方法,通过Weisfeiler-Leman颜色细化近似图同构,用于LLM输出评估和提示优化。

Comments 28 pages, This is a submitted version of a manuscript under review at IEEE Access; it has not been peer reviewed

详情

展开后加载摘要…

URL PDF HTML 收藏