arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

AI Agent

智能体、工具调用、规划、工作流、多智能体和自主任务执行。

共收录 5068 信号源:cs.AI, cs.CL, cs.LG, cs.SE

1. 工具调用 5068 篇

2512.03109 2026-05-29 cs.LG cs.AI stat.AP stat.ML 84%

E-valuator: Reliable Agent Verifiers with Sequential Hypothesis Testing

E-valuator: 基于序贯假设检验的可靠智能体验证器

Shuvom Sadhuka, Drew Prinster, Clara Fannjiang, Gabriele Scalia, Bonnie Berger, Aviv Regev, Hanchen Wang

机构 * Genentech(基因泰克) MIT(麻省理工学院) Johns Hopkins(约翰霍普金斯大学) Stanford(斯坦福大学)

专题命中 工具调用 :agent(title,abstract);agentic(abstract);分类 cs.AI、cs.LG

AI总结 提出E-valuator方法,将任意黑盒验证器分数转化为具有可控虚警率的决策规则,通过序贯假设检验实现对智能体轨迹的在线监控,提升统计功效并节省令牌。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.27485 2026-05-28 cs.LO cs.LG cs.SE 84%

Automating Formal Verification with Agent-Guided Tree Search

利用智能体引导的树搜索自动化形式验证

Leo Yao

机构 * Massachusetts Institute of Technology(麻省理工学院) Department of Electrical Engineering and Computer Science(电气工程与计算机科学系)

专题命中 工具调用 :agent(title,abstract);agentic(abstract);分类 cs.LG、cs.SE

AI总结 本文提出智能体引导的树搜索方法,通过状态和上下文两种编排器改进基于大语言模型的Lean形式验证代码生成性能,在基准测试中达到95.0%的通过率。

Comments 78 pages, 8 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.25920 2026-05-26 cs.CL cs.AI 84%

Can LLMs Time Travel? Enhancing Temporal Consistency in Legal Agentic Search through Reinforcement Learning

LLM 能时间旅行吗?通过强化学习增强法律智能搜索中的时间一致性

Wei Fan, Yining Zhou, Mufan Zhang, Yanbing Weng, Yiran HU, Tianshi Zheng, Baixuan Xu, Chunyang Li, Jianhui Yang, Haoran Li, Yangqiu Song

机构 * Department of Computer Science and Engineering, HKUST, Hong Kong SAR, China(香港科技大学计算机科学与工程系) School of Law, Tsinghua University, Beijing, China(清华大学法学院) Cheriton School of Computer Science, University of Waterloo, Waterloo, Canada(滑铁卢大学丘成桐计算机科学系)

专题命中 工具调用 :agentic(title,abstract);agent(abstract);分类 cs.AI、cs.CL

AI总结 提出 LegalSearch-R1 框架,结合本地 statute RAG 和在线搜索,通过强化学习在跨修订期数据上训练,以解决法律 LLM 的时间偏差和搜索代理缺乏时间约束的问题,在13项法律任务上超越现有方法。

Comments Under Review

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.03790 2026-05-26 cs.CL cs.AI 84%

NeoAMT: Neologism-Aware Agentic Machine Translation with Reinforcement Learning

NeoAMT: 基于强化学习的新词感知智能机器翻译

Zhongtao Miao, Kaiyan Zhao, Masaaki Nagata, Yoshimasa Tsuruoka

机构 * The University of Tokyo(东京大学) NTT Communication Science Laboratories, NTT, Inc.(NTT通信科学实验室,NTT公司)

专题命中 工具调用 :agentic(title,abstract);agent(abstract);分类 cs.AI、cs.CL

AI总结 提出NeoAMT框架,利用基于Wiktionary的搜索工具和强化学习训练翻译智能体,以提升包含新词的源句翻译质量。

Comments ACL 2026 Main. Fixed minor typos

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.00933 2026-05-21 cs.SE cs.AI 84%

MCP-Atlas: A Large-Scale Benchmark for Tool-Use Competency with Real MCP Servers

MCP-Atlas:一个大规模的工具使用能力基准测试,使用真实的MCP服务器

Chaithanya Bandi, Razvan-Gabriel Dumitru, Ben Hertzberg, Divyansh Agarwal, Geobio Boo, Tejas Polakam, Sami Hassaan, Jeff Da, HiJae Kim, Vipul Gupta, Manasi Sharma, Andrew Park, Martin Dimakis, Ernesto Gabriel Hernandez Montoya, Dan Rambado, Ivan Salazar, Rafael Cruz, MohammadHossein Rezaei, Chetan Rane, Ben Levin, Daniel Yue Zhang, Brad Kenstler, Bing Liu

机构 * National University of Singapore(新加坡国立大学) Scale AI

专题命中 工具调用 :tool-use(title,abstract);agent(abstract);分类 cs.AI、cs.SE

AI总结 本文提出MCP-Atlas,一个用于评估工具使用能力的基准测试,基于真实MCP服务器,包含1000个由人类专家编写和验证的任务,覆盖36个真实MCP服务器和220种工具,通过任务级别的评估发现模型在工具调用和认知能力上的表现。

Comments 25 pages, 3 figures, 9 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.17072 2026-05-19 cs.AI cs.CL 84%

RAGA: Reading-And-Graph-building-Agent for Autonomous Knowledge Graph Construction and Retrieval-Augmented Generation

RAGA:用于自主知识图谱构建和检索增强生成的阅读与图构建代理

Chengrui Han, Zesheng Cheng

机构 * Qingdao University(青岛大学)

专题命中 工具调用 :agent(title,abstract);分类 cs.AI、cs.CL

AI总结 本文提出RAGA框架,通过结合阅读、搜索、验证和构建的认知约束,提升知识图谱构建与检索增强生成的效率和准确性,实现了知识图谱的全生命周期管理。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.15565 2026-05-18 cs.LG cs.AI 84%

AstraFlow: Dataflow-Oriented Reinforcement Learning for Agentic LLMs

AstraFlow:面向代理大语言模型的数据流强化学习

Haizhong Zheng, Yizhuo Di, Jiahui Wang, Shuowei Jin, Xueshen Liu, Yongji Wu, Z. Morley Mao, Ion Stoica, Jiawei Zhao, Beidi Chen

机构 * Carnegie Mellon University(卡内基梅隆大学) University of Michigan(密歇根大学) UC Berkeley(加州大学伯克利分校) Meta

专题命中 工具调用 :agentic(title,abstract);tool-use(abstract);分类 cs.AI、cs.LG

AI总结 AstraFlow通过数据流导向的强化学习系统,实现复杂多策略协作训练和高效利用异构计算资源,提升代理LLM的推理与工具使用能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.15041 2026-05-15 cs.AI cs.CL 84%

Case-Based Calibration of Adaptive Reasoning and Execution for LLM Tool Use

基于案例的自适应推理与执行校准:大型语言模型工具使用

Renning Pang, Tian Lan, Leyuan Liu, Piao Tong, Sheng Cao, Xiaosong Zhang

机构 * University of Electronic Science and Technology of China(电子科技大学)

专题命中 工具调用 :tool use(title,abstract);tool-use(abstract);分类 cs.AI、cs.CL

AI总结 本文提出CAST框架,通过历史执行轨迹作为结构化案例,提取复杂性和失败特征以优化推理策略,提升工具使用准确性并减少冗余推理。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.09734 2026-05-12 cs.SE cs.AI cs.MA 84%

Trajectory Supervision for Continual Tool-Use Learning in LLMs

在大语言模型中为持续工具使用学习提供轨迹监督

Vishnu Vardhan Reddy, Sagnik Chatterjee, Soumik Bhatta

机构 * UMass Amherst(马萨诸塞大学阿默斯特分校)

专题命中 工具调用 :tool-use(title,abstract);tool use(abstract);分类 cs.AI、cs.SE

AI总结 研究通过对比保留工具使用轨迹与去除中间API轨迹的方法,发现保留轨迹能提升API调用准确率,但需更多训练token。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.07042 2026-05-11 cs.AI cs.LG 84%

The Context Gathering Decision Process: A POMDP Framework for Agentic Search

上下文收集决策过程:一种用于代理搜索的POMDP框架

Chinmaya Kausik, Adith Swaminathan, Nathan Kallus

机构 * University of Michigan(密歇根大学) Netflix

专题命中 工具调用 :agentic(title,abstract);agent(abstract);分类 cs.AI、cs.LG

AI总结 本文提出CGDP框架,通过将LLM行为建模为近似汤普森采样,引入谓词方法分解搜索过程,并设计两种干预措施提升多跳推理能力。

Comments 25 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.01264 2026-05-05 cs.SE cs.LG 84%

FeedbackLLM: Metadata driven Multi-Agentic Language Agnostic Test Case Generator with Evolving prompt and Coverage Feedback

FeedbackLLM: 基于元数据的多智能体语言无关测试用例生成器与演进提示和覆盖反馈

Kushal Jasti, Tejamani Prashanth Sahu, Rishitha Pentyala, Muvvala Mohit, Vivek Yelleti

机构 * Department of Computer Science and Engineering, SRM University AP, India(印度SRM大学计算机科学与工程系)

专题命中 工具调用 :agentic(title);agent(abstract,abstract_cn);分类 cs.LG、cs.SE

AI总结 FeedbackLLM通过双阶段方法生成测试用例,利用元数据反馈提升覆盖率,有效解决传统方法的计算开销和可扩展性问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.27233 2026-05-01 cs.AI cs.LG cs.MA 84%

Reinforced Agent: Inference-Time Feedback for Tool-Calling Agents

强化代理:推理时间的工具调用反馈

Anh Ta, Junjie Zhu, Shahin Shayandeh

机构 * Apple(苹果公司)

专题命中 工具调用 :agent(title,abstract);multi-agent(abstract);分类 cs.AI、cs.LG

AI总结 本文提出在推理时引入反馈机制,通过分离执行与审查任务,提升工具调用代理的实时纠错能力,并通过帮助性与危害性指标评估审查模型效果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.17555 2026-04-23 cs.AI cs.CL cs.IR 84%

CoSearch: Joint Training of Reasoning and Document Ranking via Reinforcement Learning for Agentic Search

CoSearch:通过强化学习联合训练推理和文档排序以实现代理搜索

Hansi Zeng, Liam Collins, Bhuvesh Kumar, Neil Shah, Hamed Zamani

机构 * Center for Intelligent Information Retrieval, University of Massachusetts Amherst(智能信息检索中心,马萨诸塞大学阿默斯特分校) Snap Inc(Snap公司)

专题命中 工具调用 :agentic(title,abstract);agent(abstract);分类 cs.AI、cs.CL

AI总结 本文提出CoSearch框架,通过群体相对策略优化联合训练推理代理和生成文档排序模型,以解决代理搜索中检索系统性能瓶颈问题,实验表明其在多个问答基准上表现优异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.16555 2026-04-21 cs.LG cs.AI cs.CV 84%

LLM as a Tool, Not an Agent: Code-Mined Tree Transformations for Neural Architecture Search

将LLM作为工具而非代理:基于代码挖掘的树变换用于神经架构搜索

Masakazu Yoshimura, Zitang Sun, Yuiko Sakuma, Junji Otsuka, Atsushi Irie, Takeshi Ohashi

机构 * Sony Group Corporation(索尼集团公司)

专题命中 工具调用 :agent(title);planning(abstract);agentic(abstract);分类 cs.AI、cs.LG

AI总结 本文提出LLMasTool框架,通过树变换实现稳定且开放的模型进化,避免LLM的固有偏差,提升NAS在CIFAR-10、CIFAR-100和ImageNet16-120上的性能。

Comments 72 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.13417 2026-04-16 cs.SE cs.AI cs.MA 84%

Bridging Protocol and Production: Design Patterns for Deploying AI Agents with Model Context Protocol

Vasundra Srinivasan

机构 * Data Engineering for Multimodal AI (O’Reilly)(多模态AI数据工程(O’Reilly))

专题命中 工具调用 :AI agent(title,abstract);agent(abstract);分类 cs.AI、cs.SE

Comments 23 pages, 5 figures, 4 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.08791 2026-04-16 cs.CL cs.AI 84%

Feedback-Driven Tool-Use Improvements in Large Language Models via Automated Build Environments

通过自动化构建环境提升大语言模型的反馈驱动工具使用

Junjie Ye, Changhao Jiang, Zhengyin Du, Yufei Xu, Xuesong Yao, Zhiheng Xi, Xiaoran Fan, Qi Zhang, Tao Gui, Xuanjing Huang, Jiecao Chen

机构 * Fudan University(复旦大学)

专题命中 工具调用 :tool-use(title,abstract);tool use(abstract);分类 cs.AI、cs.CL

AI总结 本文提出自动化环境构建流程和可验证奖励机制,提升大语言模型的工具使用能力,实验表明在不降低通用能力的情况下显著增强工具使用性能。

Comments Accepted by ACL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.06185 2026-04-09 cs.HC cs.AI cs.CL 84%

Benchmarking LLM Tool-Use in the Wild

在真实环境中评估大语言模型工具使用能力

Peijie Yu, Wei Liu, Yifan Yang, Jinjian Li, Zelong Zhang, Xiao Feng, Feng Zhang

机构 * Tencent(腾讯)

专题命中 工具调用 :tool-use(title,abstract);agentic(abstract);分类 cs.AI、cs.CL

AI总结 本文提出WildToolBench基准测试,通过评估57个LLM在真实用户行为下的表现,揭示LLM在工具使用中的鲁棒性不足,强调需重新考虑LLM、用户与工具之间的交互。

Comments accepted by ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.04949 2026-04-08 cs.IR cs.AI cs.CL 84%

Learning to Retrieve from Agent Trajectories

从智能体轨迹中学习检索

Yuqi Zhou, Sunhao Dai, Changle Qu, Liang Pang, Jun Xu, Ji-Rong Wen

机构 * Gaoling School of Artificial Intelligence, Renmin University of China(中国人民大学高瓴人工智能学院) CAS Key Laboratory of AI Safety, Institute of Computing Technology, Chinese Academy of Sciences(中国科学院计算技术研究所人工智能安全重点实验室)

专题命中 工具调用 :agent(title,abstract);agentic(abstract);分类 cs.AI、cs.CL

AI总结 本文提出从智能体交互数据直接训练检索模型的新方法,通过分析轨迹中的行为信号,提出LRAT框架提升检索性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.21240 2026-03-19 cs.LG cs.AI 84%

Tree Search for LLM Agent Reinforcement Learning

基于树搜索的LLM代理强化学习

Yuxiang Ji, Ziyu Ma, Yong Wang, Guanhua Chen, Xiangxiang Chu, Liaoni Wu

机构 * Xiamen University(厦门大学) AMAP, Alibaba Group(阿里集团AMAP实验室) Southern University of Science and Technology(南方科技大学)

专题命中 工具调用 :agent(title,abstract);agentic(abstract);分类 cs.AI、cs.LG

AI总结 本文提出Tree-GRPO方法,通过树结构提升LLM代理在长期任务中的表现,利用树搜索共享前缀以增加rollout数量,并通过理论分析证明其与直接偏好学习等效。

Comments ICLR 2026, Code: https://github.com/AMAP-ML/Tree-GRPO

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.00084 2026-03-04 cs.DL cs.AI cs.CL cs.IR 84%

DeepXiv-SDK: An Agentic Data Interface for Scientific Literature

DeepXiv-SDK: 一种用于科学文献的代理数据接口

Hongjin Qian, Ziyi Xia, Ze Liu, Jianlyu Chen, Kun Luo, Minghao Qin, Chaofan Li, Lei Xiong, Junwei Lan, Sen Wang, Zhengyang Liang, Yingxia Shao, Defu Lian, Zheng Liu

机构 * Beijing Academy of Artificial Intelligence(北京人工智能研究院)

专题命中 工具调用 :agentic(title,abstract);agent(abstract);分类 cs.AI、cs.CL

AI总结 DeepXiv-SDK通过三层代理数据接口提升科学文献的数据访问效率,支持ArXiv语料库并提供开源工具和API。

Comments Project at https://github.com/DeepXiv/deepxiv_sdk

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.16958 2026-02-20 cs.AI cs.LG 84%

Automating Agent Hijacking via Structural Template Injection

通过结构模板注入自动化代理劫持

Xinhao Deng, Jiaqing Wu, Miao Chen, Yue Xiao, Ke Xu, Qi Li

机构 * Tsinghua University \& Ant Group Hangzhou China Tsinghua University Beijing China Zhongguancuan Laboratory Beijing China Tsinghua University \& Ant Group Tsinghua University Zhongguancuan Laboratory

专题命中 工具调用 :agent(title,abstract);agentic(abstract);分类 cs.AI、cs.LG

AI总结 本文提出Phantom框架,通过结构模板注入自动化代理劫持,提升攻击成功率和效率,揭示结构模板劫持的严重性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.04726 2026-02-05 cs.SE cs.AI 84%

Supporting software engineering tasks with agentic AI: Demonstration on document retrieval and test scenario generation

用代理AI支持软件工程任务:文档检索与测试场景生成的演示

Marian Kica, Lukas Radosky, David Slivka, Karin Kubinova, Daniel Dovhun, Tomas Uhercik, Erik Bircak, Ivan Polasek

机构 * Gratex International(格拉特克斯国际) Department of Applied Informatics Faculty of Mathematics, Physics and Informatics Comenius University(应用信息学院数学、物理和信息学院康门ius大学)

专题命中 工具调用 :agentic(title,abstract);agent(abstract);分类 cs.AI、cs.SE

AI总结 本文提出利用代理AI解决软件工程中的文档检索和测试场景生成问题,通过专用代理处理不同任务,提升软件开发效率。

Comments This is a preprint of a paper that was accepted at the International Conference on Artificial Intelligence, Computer, Data Sciences and Applications (ACDSA 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.15074 2026-01-22 cs.SE cs.LG 84%

SmartOracle -- An Agentic Approach to Mitigate Noise in Differential Oracles

SmartOracle -- 一种缓解差分预言机噪声的代理方法

Srinath Srinivasan, Tim Menzies, Marcelo D'Amorim

机构 * North Carolina State University(北卡罗来纳州立大学)

专题命中 工具调用 :agentic(title,abstract);workflow(abstract);分类 cs.LG、cs.SE

AI总结 SmartOracle通过代理系统减少差分预言机噪声,提高模糊测试准确性并降低分析成本

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.03571 2025-12-04 cs.AI cs.LG cs.PL 84%

EnCompass: Enhancing Agent Programming with Search Over Program Execution Paths

EnCompass:通过程序执行路径搜索增强智能体编程

Zhening Li, Armando Solar-Lezama, Yisong Yue, Stephan Zheng

机构 * Asari AI MIT CSAIL(麻省理工学院计算机科学与人工智能实验室) Caltech CMS(加州理工学院 CMS)

专题命中 工具调用 :agent(title,abstract);workflow(abstract);分类 cs.AI、cs.LG

AI总结 EnCompass通过解耦智能体工作流逻辑与推理策略,提供一种基于Python的框架,允许快速提升智能体可靠性并灵活切换推理策略。

Comments 65 pages, 2 figures, published in NeurIPS 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.26575 2025-10-31 cs.CL cs.AI 84%

InfoFlow: Reinforcing Search Agent Via Reward Density Optimization

Kun Luo, Hongjin Qian, Zheng Liu, Ziyi Xia, Shitao Xiao, Siqi Bao, Jun Zhao, Kang Liu

机构 * Beijing Academy of Artificial Intelligence(北京人工智能研究院) Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所) Baidu Inc.(百度公司)

专题命中 工具调用 :agent(title,abstract);agentic(abstract);分类 cs.AI、cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.17365 2025-10-16 cs.LG cs.AI 84%

DynaSearcher: Dynamic Knowledge Graph Augmented Search Agent via Multi-Reward Reinforcement Learning

Chuzhan Hao, Wenfeng Feng, Yuewei Zhang, Hao Wang

机构 * Alibaba Cloud Computing(阿里巴巴云 computing)

专题命中 工具调用 :agent(title,abstract);agentic(abstract);分类 cs.AI、cs.LG

Comments 12 pages, 3 figures, 8 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.04612 2025-09-16 cs.RO cs.AI cs.LG 84%

Tool-as-Interface: Learning Robot Policies from Observing Human Tool Use

Haonan Chen, Cheng Zhu, Shuijing Liu, Yunzhu Li, Katherine Driggs-Campbell

机构 * University of Illinois, Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) UT Austin(德克萨斯大学奥斯汀分校) Columbia University(哥伦比亚大学)

专题命中 工具调用 :tool use(title,abstract);tool-use(abstract);分类 cs.AI、cs.LG

Comments Accepted to CoRL 2025. Project page: https://tool-as-interface.github.io. 17 pages, 14 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.06980 2025-09-10 cs.LG cs.AI 84%

RLFactory: A Plug-and-Play Reinforcement Learning Post-Training Framework for LLM Multi-Turn Tool-Use

Jiajun Chai, Guojun Yin, Zekun Xu, Chuhuai Yue, Yi Jia, Siyu Xia, Xiaohan Wang, Jiwen Jiang, Xiaoguang Li, Chengqi Dong, Hang He, Wei Lin

机构 * RLFactory Team(RLFactory团队)

专题命中 工具调用 :tool-use(title);tool use(abstract);workflow(abstract);分类 cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.04752 2025-09-08 cs.HC cs.AI cs.LG 84%

SePA: A Search-enhanced Predictive Agent for Personalized Health Coaching

Melik Ozolcer, Sang Won Bae

专题命中 工具调用 :agent(title,abstract);AI agent(abstract);分类 cs.AI、cs.LG

Comments Accepted at IEEE-EMBS International Conference on Biomedical and Health Informatics (BHI'25). 7 pages, 5 figures, 3 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.15495 2025-08-27 cs.CL cs.AI 84%

TL-Training: A Task-Feature-Based Framework for Training Large Language Models in Tool Use

Junjie Ye, Yilong Wu, Sixian Li, Yuming Yang, Zhiheng Xi, Tao Gui, Qi Zhang, Xuanjing Huang, Peng Wang, Zhongchao Shi, Jianping Fan, Zhengyin Du

机构 * Fudan University(复旦大学) Lenovo Research(联想研究) ByteDance Seed(字节跳动种子) Shanghai Key Lab of Intelligent Information Processing(上海智能信息处理重点实验室) Shanghai AI Laboratory(上海人工智能实验室)

专题命中 工具调用 :tool use(title,abstract);tool-use(abstract);分类 cs.AI、cs.CL

Comments Accepted by EMNLP 2025

详情

展开后加载摘要…

URL PDF HTML 收藏