arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

AI Agent

智能体、工具调用、规划、工作流、多智能体和自主任务执行。

共收录 93944 信号源:cs.AI, cs.CL, cs.LG, cs.SE

1. 工具调用 5130 篇

2310.00073 2023-10-03 cs.RO 75%

Multi-Objective Sparse Sensing with Ergodic Optimization

Ananya Rao, Howie Choset

专题命中 工具调用 :agent(abstract);planning(abstract);multi-agent(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2004.02347 2020-04-07 cs.MA cs.SY eess.SY 75%

A Receding Horizon Scheduling Approach for Search & Rescue Scenarios

Yousef Emam, Sean Wilson, Mathias Hakenberg, Ulrich Munz, Magnus Egerstedt

专题命中 工具调用 :agent(abstract);planning(abstract);multi-agent(abstract)

Comments Accepted to IFAC World Congress 2020

详情

展开后加载摘要…

URL PDF HTML 收藏
1907.10360 2020-02-07 cs.RO 75%

An Optimal Algorithm to Solve the Combined Task Allocation and Path Finding Problem

Christian Henkel, Jannik Abbenseth, Marc Toussaint

专题命中 工具调用 :agent(abstract);planning(abstract);multi-agent(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.17501 2026-08-19 cs.AI cs.LG 新提交 74%

SGHA: Evidence-Grounded Research Problem Discovery with Local Language Models

SGHA:基于证据的研究问题发现,使用本地语言模型

Sarvesh Gharat, Junpei Komiyama

机构 * C-MInDS, IIT Bombay(印度理工学院孟买分校C-MInDS) Machine Learning Department, MBZUAI(穆罕默德·本·扎耶德人工智能大学机器学习系)

专题命中 工具调用 :agent(abstract,abstract_cn);分类 cs.AI、cs.LG

AI总结 该研究提出SGHA,一种基于本地9B开源LLM的研究问题发现系统,通过构建文献证据图检测研究差距,经对比实验证明其可实现可核查的研究问题构建,无需依赖专有前沿模型。

Comments Link to Code and artifacts: https://github.com/SarveshVGharat/structural-gap-hypothesis-agent

详情

展开后加载摘要…

URL PDF HTML 收藏
2401.01841 2024-01-23 cs.AI cs.LG 74%

Act as You Learn: Adaptive Decision-Making in Non-Stationary Markov Decision Processes

Baiting Luo, Yunuo Zhang, Abhishek Dubey, Ayan Mukhopadhyay

专题命中 工具调用 :agent(abstract);planning(abstract);分类 cs.AI、cs.LG;autonomous agent(comments)

Comments Accepted for publication at the International Conference on Autonomous Agents and MultiAgent Systems (AAMAS), 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.24957 2026-08-27 cs.CR cs.SE 新提交 74%

ToolMinimize: Auditing and Rewriting LLM Agent Tool Calls to Minimize Privacy Exposure

ToolMinimize:审计与重写大语言模型智能体的工具调用以最小化隐私暴露

Wenbiao Li, Yuqiao Xu

专题命中 工具调用 :agent(title);分类 cs.SE

AI总结 ToolMinimize是一款中间件,通过拦截并重写LLM智能体的工具调用参数,结合schema感知分析与四种操作,在保证100%任务有效性的同时大幅降低隐私暴露,可选层可进一步提升效果,延迟极低。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.24809 2026-08-26 cs.CL cs.IR 新提交 74%

Structurally-bounded Agentic Graph Exploration for Evidence-Grounded Scholarly DeepSearch

用于证据导向学术深度搜索的结构受限智能体图探索方法

Rima Hazra, Sayan Layek, Somnath Banerjee, Soumen Chakrabarti, Animesh Mukherjee

机构 * National University of Singapore(新加坡国立大学) TCG CREST Indian Institute of Technology Kharagpur(印度理工学院卡拉格普尔分校) Singapore Institute of Technology(新加坡理工学院) Indian Institute of Technology Bombay(印度理工学院孟买分校)

专题命中 工具调用 :agentic(title);分类 cs.CL

AI总结 Crase是一种有界可检查的学术搜索方法,通过1.5跳引用邻域扩展等操作,在50万篇arXiv论文的基准上,召回率@50最高达同类深度研究智能体的3倍且成本仅为其三分之一。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.24114 2026-08-26 cs.AI 新提交 74%

AHEAD: Adaptive Hindsight with Environment-Augmented Distillation for Agentic RL

AHEAD:用于智能体强化学习的环境增强蒸馏自适应回溯

Xiaolong Jin, Dingmin Wang, Vijay Lingam, Varun Kumar

机构 * AWS AI Labs(亚马逊云科技人工智能实验室) Purdue University(普渡大学)

专题命中 工具调用 :agentic(title);分类 cs.AI

AI总结 AHEAD是一种步骤感知的智能体强化学习框架,通过匹配不同监督源适配步骤类型,在多任务及多模型规模下提升了GRPO算法的任务成功率,减少了训练步骤并适配更严格的交互预算。

Comments 22 pages, 15 figures, 7 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.22331 2026-08-25 cs.CL 新提交 74%

Noise Floor Audit for Agent Benchmarks

智能体基准测试的噪声底审计

Yihang Chen, Pin Qian, Su Wang, Chong Peng, Huan Xu, Xiyang Wu, Yiqi Sun

专题命中 工具调用 :agent(title);分类 cs.CL

AI总结 该研究针对BFCL基准的工具调用端点,审计了重复运行与提示扰动带来的测量变异性,发现提示扰动是更大噪声来源,边际准确率掩盖了稳定性与失败模式。

Comments 10 pages, 1 figure, 6 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.11250 2026-08-13 cs.AI cs.MA q-fin.CP q-fin.PM 新提交 74%

AgonAlpha: Autonomous Alpha Discovery via Prompt Economy and Scalable Agentic Search

AgonAlpha:通过提示经济与可扩展智能体搜索实现自主阿尔法发现

Weicheng Ye, Youran Sun, Xingyu Ren, Shunyao Yu, Chugang Yi, Haizhao Yang

机构 * The Chinese University of Hong Kong(香港中文大学) University of Maryland(马里兰大学)

专题命中 工具调用 :agentic(title);分类 cs.AI

AI总结 AgonAlpha是首个结合经验证构件搜索、对抗审核器与并行预算分配的阿尔法挖掘系统,在WorldQuant BRAIN部署后产出SPECTACULAR级阿尔法,为交易因子自主研究提供了完整证据轨迹。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.08477 2026-08-11 cs.CL 新提交 74%

VectraYX-Vision-1B: A Sub-2B Spanish/LATAM Cybersecurity Vision-Language Model with Structured Visual Reasoning and Native Tool Use

VectraYX-Vision-1B:一款具备结构化视觉推理与原生工具使用能力的20亿参数以下西班牙语/拉丁美洲网络安全多模态模型

Juan S. Santillana

机构 * Globant(高博特科技)

专题命中 工具调用 :tool use(title);分类 cs.CL

AI总结 本研究推出VectraYX-Vision-1B,一款20亿参数以下西班牙语/拉丁美洲网络安全多模态模型,支持结构化推理与工具调用,针对网络UI优化,同时报告了其视觉定位的负面结果及相关修复方案,开源了模型与数据。

Comments 11 pages, 1 figure

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.06871 2026-08-10 cs.AI 新提交 74%

CEDAR: Agent-Orchestrated Tree Search for Goal-Directed Optimization of Complex Systems

CEDAR:面向复杂系统目标导向优化的智能体编排树搜索算法

Yingtao Tian

机构 * Sakana AI

专题命中 工具调用 :agent(title);分类 cs.AI

AI总结 针对复杂系统目标导向设计的难题,提出基于LLM智能体的CEDAR方法,通过LLM驱动的MCTS实现复杂系统的目标导向发现,减少人力投入并促进其跨领域应用。

Comments Accepted as Talk in ALIFE 2026: The 2026 Conference on Artificial Life

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.02376 2026-08-07 cs.DB cs.CL cs.IR 版本更新 74%

Token-Native Storage: Read and Write in your Agent's Language

令牌原生存储:以智能体的语言进行读写

Kumar Shivendu

机构 * Qdrant

专题命中 工具调用 :agent(title);分类 cs.CL

AI总结 本文提出令牌原生存储思路,将文本以模型的BPE令牌ID保存,压缩比和读写速度均优于UTF-8等字节编码,呼吁AI实验室标准化令牌化器以推进该方案。

Comments 12 pages, 6 figures, 2 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.01321 2026-08-04 cs.CL 新提交 74%

BiCAA: Bidirectional Credit Assignment for Search-Augmented Agent

BiCAA:面向搜索增强智能体的双向信用分配

Yibin Huang, Bin Xu, Hailong Cao, Conghui Zhu

专题命中 工具调用 :agent(title);分类 cs.CL

AI总结 针对搜索增强智能体多步搜索任务中普通GRPO的稀疏监督问题,提出BiCAA双向信用分配框架,融合前向可解性增益与后见成功关键性构建密集过程奖励,实现稳定策略优化并取得有竞争力的QA性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.07984 2026-07-10 cs.AI 新提交 74%

Agentic Neural Architecture Search

智能体神经架构搜索

Seokhoon Jeong, Mijung Kim, Taehwan Kim

机构 * Artificial Intelligence Graduate School, Ulsan National Institute of Science and Engineering(人工智能研究生院,乌山科学与工程研究院) Department of Computer Science and Engineering, Ulsan National Institute of Science and Engineering(计算机科学与工程系,乌山科学与工程研究院)

专题命中 工具调用 :agentic(title);分类 cs.AI

AI总结 研究探索LLM驱动设计与NAS驱动搜索的分工,提出用LLM生成种子架构并分解为带插槽架构供NAS搜索的机制,在AgentNAS中实例化,在多任务上表现出色,两种搜索机制互补。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.06155 2026-07-08 cs.FL cs.CC cs.CL 新提交 74%

When Does Tool Use Increase the Expressive Power of Finite-Precision Recurrent Models?

工具使用何时会增强有限精度循环模型的表达能力?

Nikola Zubić, Qian Li, Yuyi Wang, Davide Scaramuzza

机构 * Robotics and Perception Group University of Zurich(机器人感知组苏黎世大学) Shenzhen International Center for Industrial and Applied Mathematics(深圳国际工业与应用数学中心) Shenzhen Research Institute of Big Data(深圳大数据研究 institute) Tengen Intelligence Institute CRRC Zhuzhou Institute(腾云智能研究院 CRRC 长沙研究所)

专题命中 工具调用 :tool use(title);分类 cs.CL

AI总结 研究工具使用对有限精度循环模型表达能力的影响,通过将模型建模为与预言机交互的有限状态控制器,得出有限状态工具基本不增加表达能力,单个无限状态磁带使系统图灵完备,且特定单层控制器可实现此构造的结论。

Comments 24 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.01465 2026-07-03 cs.AI 新提交 74%

Beyond Next-Token Prediction: An RLVR Proof of Concept for Tool-Use Agents on Atlassian Workflows

超越下一个词预测:Atlassian工作流中工具使用代理的RLVR概念验证

Karthikeya Aditya Vissa, Sankalp Mane, Ananya Mantravadi, Harshit Rajgarhia, Abhishek Mukherji

机构 * Centific

专题命中 工具调用 :tool-use(title);分类 cs.AI

AI总结 针对企业SaaS工作流中LLM因目标不匹配导致的静默失败,提出在目标环境中直接应用可验证奖励强化学习(RLVR),在五个合成Jira/Confluence环境中训练Qwen模型,将平均奖励从0.35-0.92提升至0.95-1.00。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.24636 2026-07-02 cs.CL 版本更新 74%

OpenReward: Learning to Reward Long-form Agentic Tasks via Reinforcement Learning

OpenReward: 通过强化学习学习奖励长形式智能体任务

Ziyou Hu, Zhengliang Shi, Minghang Zhu, Haitao Li, Teng Sun, Pengjie Ren, Suzan Verberne, Zhaochun Ren

机构 * Leiden University(莱顿大学) Shandong University(山东大学) Tsinghua University(清华大学)

专题命中 工具调用 :agentic(title);分类 cs.CL

AI总结 提出OpenRM,一种工具增强的长形式奖励模型,通过GRPO训练联合监督工具使用和结果准确性,在长形式任务中显著优于现有方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.20113 2026-06-23 cs.CL cs.IR 新提交 74%

When Does Streaming Tool Use Help? Characterizing Tool-Intent Stabilization in Streaming Retrieval-Augmented Generation

流式工具使用何时有帮助?表征流式检索增强生成中的工具意图稳定化

Elroy Galbraith

机构 * SMG Labs(SMG实验室)

专题命中 工具调用 :tool use(title);分类 cs.CL

AI总结 通过测量工具意图稳定化(即推测查询收敛到答案的时间点),在CRAG基准上分析流式RAG的延迟隐藏效果,发现73.9%的查询可实现显著延迟隐藏,并识别早期与晚期稳定化的预测因素。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.10709 2026-06-10 cs.IR cs.AI 新提交 74%

Effective Reinforcement Learning for Agentic Search by Recycling Zero-Variance Queries During Training

通过训练期间回收零方差查询实现智能体搜索的有效强化学习

João Coelho, João Magalhães, Bruno Martins, Chenyan Xiong

机构 * Language Technologies Institute, Carnegie Mellon University(卡内基梅隆大学语言技术研究所) Instituto Superior Técnico and INESC-ID, University of Lisbon(里斯本大学理工学院和INESC-ID) NOVA LINCS, NOVA School of Science and Technology(NOVA科学与技术学院LINCS)

专题命中 工具调用 :agentic(title);分类 cs.AI

AI总结 提出查询回收方法,将训练中零方差查询重新投入采样池,使有效训练分布随策略演化,1.7B模型在7个多跳QA基准上平均Pass@1达66.0,匹配或超越7B模型。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.19218 2026-06-10 cs.SE cs.MA 版本更新 74%

Gecko: A Simulation Environment with Stateful Feedback for Refining Agent Tool Calls

Gecko: 一种具有状态反馈的仿真环境,用于优化智能体工具调用

Zeyu Zhang, Guohao Li, Zhenchang Xing, Alexandros Apostolopoulos, Yu Lin Lee, Liang Zheng

专题命中 工具调用 :agent(title);分类 cs.SE

AI总结 提出Gecko仿真环境,通过规则与LLM结合提供工具名称/参数验证、模式一致响应合成和任务完成判断三类反馈,形成GATS方法,在BFCLv3和τ²-bench上显著提升LLM工具调用性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.01839 2026-06-02 cs.DC cs.AR cs.LG 74%

Observation, Not Prediction: Conversation-Level Disaggregated Scheduling for Agentic Serving

观察而非预测:面向智能体服务的对话级解耦调度

Jianru Ding, Ryien Hosseini, Pouya Mahdi Gholami, Mingyuan Xiang, Henry Hoffmann

机构 * Anonymous Authors(匿名作者)

专题命中 工具调用 :agentic(title);分类 cs.LG

AI总结 提出将调度单元从单轮提升至整个对话,利用对话中首轮计算密集与后续内存密集的两阶段可观察特性,实现无需预测的解耦调度,显著降低延迟并提升能效。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.01314 2026-06-02 cs.AI 74%

SkillSmith: Co-Evolving Skills and Tools for Self-Improving Agent Systems

SkillSmith: 技能与工具的协同进化用于自我改进的智能体系统

Yangbo Wei, Zhen Huang, Shaoqiang Lu, Junhong Qian, Qifan Wang, Chen Wu, Lei He

机构 * Shanghai Jiao Tong University(上海交通大学) Eastern Institute of Technology(东部技术研究所) University of Science and Technology of China(中国科学技术大学) Southeast University(东南大学) Ningbo Institute of Digital Twin(宁波数字孪生研究所)

专题命中 工具调用 :agent(title);分类 cs.AI

AI总结 提出SkillSmith框架,通过统一提案空间和Lotka-Volterra生态效用模型实现技能与工具的协同进化,在多个基准测试中显著提升性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.09287 2026-05-13 cs.AI 74%

PiCA: Pivot-Based Credit Assignment for Search Agentic Reinforcement Learning

PiCA:基于枢纽的搜索代理强化学习中的信用分配

Dongyi Liu, Yifan Niu, Qinwen Wang, Han Xiao, Jia Li

机构 * The Hong Kong University of Science and Technology (Guangzhou)(香港科学与技术大学(广州)) The Hong Kong University of Science and Technology(香港科学与技术大学)

专题命中 工具调用 :agentic(title);分类 cs.AI

AI总结 PiCA通过重新定义搜索轨迹为累积搜索进度的序列过程,解决长周期信用分配中的稀疏奖励、孤立信用和分布偏移问题,提升知识密集型问答任务性能。

Comments 21 pages, 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.05247 2026-05-08 cs.SE 74%

DADL: A Declarative Description Language for Enterprise Tool Libraries in LLM Agent Systems

DADL:用于LLM代理系统企业工具库的声明性描述语言

Axel Dunkel

专题命中 工具调用 :agent(title);分类 cs.SE

AI总结 DADL通过单一声明性文件描述REST API的端点、认证、分页等,实现企业工具库的集中管理和高效调用,显著降低上下文窗口消耗。

Comments 14 pages, 1 figure. Also published on Zenodo: https://doi.org/10.5281/zenodo.19931788

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.22821 2026-04-29 cs.SD cs.LG eess.AS 74%

Audio2Tool: Speak, Call, Act -- A Dataset for Benchmarking Speech Tool Use

Audio2Tool: 说话,呼叫,行动 -- 一个用于语音工具使用的基准测试数据集

Ramit Pahwa, Apoorva Beedu, Parivesh Priye, Rutu Gandhi, Saloni Takawale, Aruna Baijal, Zengli Yang

机构 * Rivian and Volkswagen Group Technologies(Rivian和大众集团技术公司)

专题命中 工具调用 :tool use(title);分类 cs.LG

AI总结 Audio2Tool数据集通过三个领域评估语音语言模型的工具调用能力,包含30000个查询,涵盖简单指令到复杂多意图任务,测试模型在不同挑战下的表现。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.23281 2026-04-22 cs.CL 74%

MCP vs RAG vs NLWeb vs HTML: A Comparison of the Effectiveness and Efficiency of Different Agent Interfaces to the Web (Technical Report)

MCP与RAG与NLWeb与HTML:不同网页代理接口的有效性和效率比较(技术报告)

Aaron Steiner, Ralph Peeters, Christian Bizer

机构 * Data and Web Science Group(数据与网络科学组) University of Mannheim(曼海姆大学)

专题命中 工具调用 :agent(title);分类 cs.CL

AI总结 本文比较了四种网页代理接口的有效性和效率,发现RAG、MCP和NLWeb在效果和效率上均优于HTML。

Journal ref Proceedings of the ACM Web Conference 2026 (WWW '26), April 13-17, 2026, Dubai, United Arab Emirates. ACM, New York, NY, USA, pp. 8493-8496

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.12967 2026-04-15 cs.AI 74%

Cycle-Consistent Search: Question Reconstructability as a Proxy Reward for Search Agent Training

循环一致性搜索:问题可重构性作为搜索代理训练的代理奖励

Sohyun An, Shuibenyang Yuan, Hayeon Lee, Cho-Jui Hsieh, Alexander Min

机构 * Meta Superintelligence Labs(Meta超智能实验室)

专题命中 工具调用 :agent(title);分类 cs.AI

AI总结 本文提出Cycle-Consistent Search框架,通过问题可重构性作为奖励信号,无需黄金监督训练搜索代理,在信息检索任务中实现与监督基线相当的性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.09093 2026-04-13 cs.CR cs.CL 74%

Exploiting Web Search Tools of AI Agents for Data Exfiltration

利用AI代理的网络搜索工具进行数据外泄

Dennis Rall, Bernhard Bauer, Mohit Mittal, Thomas Fraunholz

机构 * Open Hippo GmbH(Open Hippo有限公司) University of Augsburg(奥格斯堡大学) Smart Labs AI GmbH(Smart Labs AI有限公司)

专题命中 工具调用 :AI agent(title);分类 cs.CL

AI总结 研究分析了AI代理通过网络搜索工具进行数据外泄的攻击方式,探讨了模型大小、制造商及实现方式对漏洞的影响,并提出加强训练、建立攻击向量数据库和统一测试框架等安全措施。

Comments 9 pages, 6 figures, conference article

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.09375 2026-03-12 cs.LG 74%

Latent Poincaré Shaping for Agentic Reinforcement Learning

隐式庞加莱形变用于代理强化学习

Hanchen Xia, Baoyou Chen, Zelin Zang, Yutang Ge, Guojiang Zhao, Siyu Zhu

专题命中 工具调用 :agentic(title);分类 cs.LG

AI总结 LaPha通过在庞加莱潜在空间中引入隐式形变,提升LLM代理在数学任务中的性能,实现自我引导的测试时间扩展和更高的准确率。

详情

展开后加载摘要…

URL PDF HTML 收藏