arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

AI Agent

智能体、工具调用、规划、工作流、多智能体和自主任务执行。

共收录 7527 信号源:cs.AI, cs.CL, cs.LG, cs.SE

1. 工具调用 578 篇

2608.05987 2026-08-07 cs.AI cs.LG 新提交 81%

AgentOPSD: Recursive Self-Distillation for Agentic Reinforcement Learning

AgentOPSD:面向智能体强化学习的递归自蒸馏方法

Zi-Han Wang, Zhengxi Lu, Zhiyuan Yao, Jinyang Wu, Jie Wu, Zhengzhou Cai, Yueqing Sun, Ziang Ye, Linji Hao, Qi Gu, Xunliang Cai, Yongliang Shen, Yujiu Yang

机构 * Tsinghua University(清华大学) Zhejiang University(浙江大学) Meituan(美团)

专题命中 工具调用 :agentic(title,abstract);分类 cs.AI、cs.LG

AI总结 提出 AgentOPSD 这一无 critic 的递归自蒸馏方法,用于智能体强化学习的轮次级 credit 分配,在 ALFWorld 等数据集上优于 GRPO 等基线,在 Qwen2.5-7B 模型上实现 ALFWorld 89.1% 的成功率。

Comments Code: https://github.com/ZethWang/AgentOPSD

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.03527 2026-08-05 cs.IR cs.AI cs.CL 新提交 81%

Training Documents Reranker with Search Rubrics for Deep Research Agent

面向深度研究智能体的、基于搜索 rubrics 的训练文档重排序器

Wenhan Liu, Yu Lu, Qiaolin Xia, Hui Xu, Tong Zhao, Jian Xi, Yutao Zhu, Haijin Liang, Haibo Shi, Hao Wang, Zhicheng Dou

机构 * Gaoling School of Artificial Intelligence, Renmin University of China(中国人民大学高瓴人工智能学院) Tencent(腾讯)

专题命中 工具调用 :agent(title,abstract);分类 cs.AI、cs.CL

AI总结 针对现有检索器无法满足深度研究智能体复杂信息需求的问题,提出搜索 rubrics 并训练文档重排序器 RubricRanker,在多基准上取得优于基线的性能且泛化性良好。

Comments 28 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.03222 2026-08-05 cs.SE cs.AI 新提交 81%

Fail-Fast, Restart-Smart: Early Failure Prediction and Restart for SWE Agentic Tasks

快速失败,智能重启:面向软件工程智能体任务的早期失败预测与重启

Chenyu Wang, Yunbo Lyu, Junda He, Zhou Yang, Chenxing Zhong, Yaniv Harel, David Lo

专题命中 工具调用 :agentic(title);agent(abstract);分类 cs.AI、cs.SE

AI总结 本文提出FailFast-RestartSmart两阶段控制器,可在5%假阳性率下节省14.6%-20.4%执行token,在25%假阳性率下将Qwen3.6-27B解决率从66.6%提至71.8%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.02645 2026-08-05 cs.SE cs.AI 新提交 81%

Verified Tool Calls Improve LLM Agent Reliability Under Non-Atomic Failures

经验证的工具调用可提升非原子故障下LLM智能体的可靠性

Isham Kalappurackal Mansoor, Abhishek Phadke, Pratip Rana

机构 * Old Dominion University(奥多明尼昂大学) Christopher Newport University(克里斯托弗·纽波特大学)

专题命中 工具调用 :agent(title,abstract);分类 cs.AI、cs.SE

AI总结 针对非原子故障导致LLM智能体可靠性不足的问题,提出带后置条件验证、重试前逻辑和幂等键的工具包装器,可减少重复动作并保持任务成功率,且无需修改底层LLM。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.20668 2026-07-24 cs.CL cs.AI 新提交 81%

From Agent Failures to Text Policies: What Works and What Breaks

从智能体失败到文本策略:可行与不可行之处

Jaideep Ray, Ankit Goyal

专题命中 工具调用 :agent(title,abstract);分类 cs.AI、cs.CL

AI总结 研究智能体中TextGrad应用问题,通过区分遵循与学习策略能力来研究。发现两者有差距,人工编写策略能提升智能体表现,而从轨迹生成的策略无法可靠超越固定提示,主要挑战是从经验中生成和选择策略。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.18308 2026-07-22 cs.LG cs.AI 新提交 81%

Agentic Calibration of Grey-Box Simulation Models: An LLM-Driven Alternative

灰箱仿真模型的智能校准:一种由大语言模型驱动的替代方法

David Gómez-Guillén, Mireia Diaz, Josep Lluis Arcos, Jesús Cerquides

机构 * Catalan Institute of Oncology-IDIBELL(加泰罗尼亚肿瘤研究所-IDIBELL) Autonomous University of Barcelona(巴塞罗那自治大学) Centro de Investigación Biomédica en Red de Epidemiología y Salud Pública(国家公共卫生与流行病学网络生物医学研究中心) Artificial Intelligence Research Institute, IIIA-CSIC(人工智能研究所,西班牙科学研究委员会-人工智能研究所)

专题命中 工具调用 :agentic(title,abstract);分类 cs.AI、cs.LG

AI总结 研究灰箱仿真模型校准问题,提出用大语言模型作优化器的智能校准方法,在肛门癌仿真模型上评估,结果表明该方法在减少模型评估次数上有优势,虽迭代推理时间增加,但可审计和解释,适用于仿真时间占主导的情况。

Comments Manuscript: 19 pages, 2 figures. Appendix: 11 pages, 1 figure

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.06854 2026-07-09 cs.LG cs.AI cs.GT 新提交 81%

A Gold-Standard Study of What Makes a Lightweight Game-Playing Agent Strong

关于使轻量级博弈代理强大的因素的金标准研究

Nima Kelidari, Mohammadsaeed Haghi, Mahdi Salmani

机构 * University of Southern California(美国南加州大学)

专题命中 工具调用 :agent(title,abstract);分类 cs.AI、cs.LG

AI总结 研究不完美信息纸牌游戏中使轻量级博弈代理强大的因素,构建专家代理作标准,经超百次运行确定有效因素,添加基线并应用于另一游戏,得出通用方法可训练有竞争力代理且无需专家训练。

Comments 9 pages, 5 figures, 3 tables. Code and models: https://github.com/Nikelroid/adversarial-coevolution

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.03333 2026-07-07 cs.DC cs.AI cs.LG 新提交 81%

SPORK: Self-Speculative Forking to Accelerate Agentic LLM Inference

SPORK:自我推测性分叉以加速智能体大语言模型推理

Huajun Bai, Weiwei Lv, Huichuan Zheng, Youyou Lu, Jiwu Shu

机构 * Tsinghua University(清华大学) Meituan(美团)

专题命中 工具调用 :agentic(title);workflow(abstract);分类 cs.AI、cs.LG

AI总结 研究LLM智能体推理中串行循环耗时问题,提出SPORK方法,利用模型自身预测提前调度推测工具调用,通过成本模型等组件优化,大幅提升推理效率且不影响任务准确性。

Comments 16 pages, 15 figures. Code: https://github.com/baihuajun24/spork

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.00297 2026-07-02 cs.LG cs.CL 新提交 81%

EPC: A Standardized Protocol for Measuring Evaluator Preference Dynamics in LLM Agent Systems

EPC:一种用于测量LLM智能体系统中评估者偏好动态的标准协议

Zewen Liu

专题命中 工具调用 :agent(title,abstract);分类 cs.CL、cs.LG

AI总结 提出EPC协议,通过四阶段隔离范式标准化测量LLM智能体系统中评估者偏好耦合现象,并提供参考快照和版本约定以支持复现、比较和衰减检测。

Comments 10 pages, 3 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.25819 2026-06-25 cs.CL cs.SE 新提交 81%

Beyond Function Calling: Benchmarking Tool-Using Agents under Tool-Environment Unreliability

超越函数调用:工具环境不可靠性下的工具使用智能体基准测试

Yang Tian, Zhengpeng Shi, Yu Zhou, Bo Zhao

机构 * School of AI, Shanghai Jiao Tong University(上海交通大学人工智能学院)

专题命中 工具调用 :function calling(title);tool-use(abstract);分类 cs.CL、cs.SE

AI总结 提出ToolBench-X基准,在工具环境中注入五种可恢复可靠性风险,评估智能体任务完成能力,发现可靠工具下表现良好的智能体在可恢复风险下失败,失败主因是诊断和恢复能力不足。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.13662 2026-06-15 cs.AI cs.CL 新提交 81%

EurekAgent: Agent Environment Engineering is All You Need For Autonomous Scientific Discovery

EurekAgent:自主科学发现中,智能体环境工程即一切

Amy Xin, Jiening Siow, Junjie Wang, Zijun Yao, Fanjin Zhang, Jian Song, Lei Hou, Juanzi Li

机构 * Department of Computer Science and Technology, Tsinghua University(清华大学计算机科学与技术系) Zhipu AI(智谱AI)

专题命中 工具调用 :agent(title,abstract);分类 cs.AI、cs.CL

AI总结 提出环境工程框架EurekAgent,通过权限、工件、预算和人机交互四维工程设计,在数学、内核工程和机器学习任务上取得新最优结果,总API成本低于11美元。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.08696 2026-06-09 cs.LG cs.AI 新提交 81%

Agentic Search for Counterfactual Recourse under Fixed LLM Budgets

固定LLM预算下的反事实追索的智能搜索

Yasuo Tabei

机构 * RIKEN Center for Advanced Intelligence Project(日本RIKEN高级智能项目中心)

专题命中 工具调用 :agentic(title,abstract);分类 cs.AI、cs.LG

AI总结 提出Comp-MCTS框架,在固定LLM调用预算下,通过树搜索最大化生成唯一且经oracle验证的反事实,平衡数量与质量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.21553 2026-06-23 cs.CL cs.IR 新提交 80%

Dissecting Agentic RAG: A Component Ablation for Multi-Hop QA with a Local 7B Model

解析智能体RAG:基于本地7B模型的多跳问答组件消融研究

Sheroz Shaikh

机构 * Independent Researcher(独立研究员)

专题命中 工具调用 :agentic(title,abstract);分类 cs.CL

AI总结 通过消融实验,发现固定混合检索和短检索循环对多跳问答贡献最大,自适应路由和深度循环并非必要。

Comments 8 pages, 4 figures, 4 tables. Code: https://github.com/sherozshaikh/agentic-rag-eval

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.28055 2026-07-31 cs.IR 新提交 80%

VIG-RL: Learning to Search and Insert for Verified Image Grounding

VIG-RL:学习搜索与插入以实现可验证的图像定位

Qinhan Yu, Jun Guang, Chong Chen, Wentao Zhang

专题命中 工具调用 :agent(abstract);autonomous agent(abstract);workflow(abstract);agentic(abstract)

AI总结 本文针对现有检索增强框架无法动态推理视觉证据插入时机与位置的问题,提出自主智能体框架VIG-RL,将相关工作流建模为主动决策过程,经强化学习优化后实现SOTA性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.27994 2026-08-31 cs.CR cs.SE 新提交 79%

Moirae: A Multimodal Agent Collaborative Framework for Dynamic Android Malware Detection

Moirae:用于动态Android恶意软件检测的多模态智能体协作框架

Xueying Zeng, Youquan Xian, Yanze Li, bowen hu, Ziqi Shan, Xu Luo, DanPing Yang, Peng Liu, Lei Cui, Bo Li

专题命中 工具调用 :agent(title,abstract);分类 cs.SE

AI总结 该研究提出多模态智能体协作框架Moirae,通过融合多维度运行时证据实现动态Android恶意软件检测,在未见过的数据集上零样本准确率达90.06%,优于现有基线且抗概念漂移。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.21808 2026-08-25 cs.CL 新提交 79%

MCite-RL: Towards Reliable Multimodal RAG via Citation-enhanced Agentic Reinforcement Learning

MCite-RL:基于引用增强型智能体强化学习的可靠多模态检索增强生成

Suifeng Zhao, Zida Liu, Xinyu Lei, Lei Sun, Jun Gao, Sujian Li

机构 * Peking University(北京大学) Panasonic Connect Co., Ltd.(松下连接株式会社)

专题命中 工具调用 :agentic(title,abstract);分类 cs.CL

AI总结 针对现有多模态RAG存在的视觉引用不准或与答案脱节问题,本文提出MCite-RL框架,通过智能体优化模块和引用增强型奖励机制实现引用精度与答案质量的联合优化,经多基准实验验证有效。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.20844 2026-08-24 cs.AI 新提交 79%

TRACE: Agentic Catalog Enrichment with Multi-source Evidence Grounding

TRACE:基于多源证据锚定的智能体式商品目录丰富

Rohan Kumar, Steven Xu, Kyle MacDonald, Matthew Long, Bernice Chow, Mac VanRenterghem, Sudeep Das

机构 * DoorDash(多闸道科技(DoorDash))

专题命中 工具调用 :agentic(title,abstract);分类 cs.AI

AI总结 针对电商商品目录属性稀疏问题,提出基于LLM的TRACE框架,经离线评估、生产部署及在线实验验证,可高效提升目录属性丰富的准确率、覆盖率及结账转化率。

Comments 12 pages, 2 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.15877 2026-08-18 cs.AI 新提交 79%

Dear Algo: A Precision-First Agentic Intent Layer for Unified Search and Recommendation

Dear Algo:面向统一搜索与推荐的精准优先智能体意图层

Rui Wang, Jiazhou Wang, Zheng Wei, Chenglin Lu, Fangcheng Sun, Ivy Sun, Jin Sun, Hui Geng, Lillian Zhang, Chao Yang, Lei Chen, Shahin Sefati, Reem Helou, Joe Zhou, Babak Shakibi, Yiyi Pan, Bi Xue, Hong Yan, Shujian Bu

机构 * Meta Platforms Inc.(元平台公司) Google DeepMind(谷歌DeepMind)

专题命中 工具调用 :agentic(title,abstract);分类 cs.AI

AI总结 该研究提出面向统一搜索与推荐的精准优先智能体意图层Dear Algo,将多类型意图编译为可执行计划,实验显示其在精度、候选数量及用户相关性上均优于基线。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.09622 2026-08-11 cs.AI cs.SY eess.SY 新提交 79%

Adaptive Sequential Test Planning for Multi-Mechanism Reliability Qualification via Bayesian Monte Carlo Tree Search

基于贝叶斯蒙特卡洛树搜索的多机制可靠性鉴定自适应序贯测试规划

Youssef A. Elhagrasy, Ian Hill, André Ivanov

机构 * University of British Columbia(英属哥伦比亚大学)

专题命中 工具调用 :planning(title,abstract);分类 cs.AI

AI总结 该研究针对多机制半导体可靠性鉴定,提出结合MCTS-SA与EKF的闭环自适应序贯测试规划框架,实验显示其表征良率较非自适应策略大幅提升。

Comments Accepted to IEEE Transactions on Reliability

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.09577 2026-08-11 cs.AI 新提交 79%

ElasticBack: Stealthy Conditional Backdoor in LLM-Agent Skills via Coupled Trigger-Rule Optimization

ElasticBack:通过耦合触发-规则优化实现LLM智能体技能中的隐蔽条件后门

Hao Sui, Simeng Qin, Jie Liao, Xiaojun Jia, Bing Chen, Yang Liu

专题命中 工具调用 :agent(title,abstract);分类 cs.AI

AI总结 本研究提出ElasticBack,通过耦合触发-规则优化在LLM智能体技能中植入条件性单技能后门,实验显示其攻击性能优异且隐蔽性强,可推动技能供应链的防御研究。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.08700 2026-08-11 cs.AI 新提交 79%

PluginEval: A Diagnostic Benchmark for Fine-Grained Error Attribution in Function Calling

PluginEval:用于函数调用细粒度错误归因的诊断基准

Dongjie Xu, Julius, Hanchi Dong, Minghua Tang, Yuxuan Sun, Ziwei Nie, Zicheng Liu, Dujun Qing, Jiajie Xu

专题命中 工具调用 :function calling(title);autonomous agent(abstract);分类 cs.AI

AI总结 PluginEval是缓解现有函数调用基准局限的两阶段诊断基准,可细粒度归因错误,评估显示不同模型在难度级别和错误类别中存在性能差异,且其LLM判断器与人类标注一致性良好。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.07925 2026-08-11 cs.AI 新提交 79%

ZhuLong: Execution-Grounded LLM Agent for EDA Scripting with Offline API Self-Exploration

ZhuLong:基于执行的大语言模型智能体,用于结合离线API自探索的EDA脚本编写

Yang Liu, Shiwei Hou, Xiyuan Chen, Yu Wang, Sen Yuan, Qirui Gan, Shao You, Feifan Chen, Wencheng Li, Shuyang Hu, Yongzhou Liu, Emma Xia, Xiaojing Lu, Hao Wang, Fan Xu, Yanfeng Li

机构 * Changxin Memory Technologies, Inc.(长鑫存储技术有限公司)

专题命中 工具调用 :agent(title,abstract);分类 cs.AI

AI总结 本文提出基于执行的LLM智能体ZhuLong,结合API检索、沙箱执行与离线API自探索机制,在EDA脚本任务基准测试中性能远超纯LLM基线,为EDA脚本编写提供了有效解决方案。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.06790 2026-08-10 cs.SE 新提交 79%

AgentChaos: Chaos Engineering for Agent Systems via Programmatic Fault Injection

AgentChaos:通过可编程故障注入实现智能体系统的混沌工程

Gou Tan, Zhensu Sun, Jieke Shi, Ting Zhang, Zilong He, Qingfu Wu, Shuai Liang, Weifeng Sun, Junda He, Pengfei Chen, Chuanfu Zhang, Lwin Khin Shar, David Lo

专题命中 工具调用 :agent(title,abstract);分类 cs.SE

AI总结 提出AgentChaos框架,在不修改源代码的情况下于LLM API共享层注入故障,评估显示智能体系统鲁棒性取决于自身实现,现有故障诊断方法仍有提升空间。

Comments Accepted at the 41st IEEE/ACM International Conference on Automated Software Engineering (ASE 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.06057 2026-08-07 cs.AI 新提交 79%

When History Lies: Evaluating and Improving Tool Use under Misleading Multi-Turn Histories

当历史失效:在误导性多轮历史下评估与改进工具使用

Xiaoqing Wu, Xingyu Fan, Feifei Li, Wenhui Que

专题命中 工具调用 :tool use(title);tool-use(abstract);分类 cs.AI

AI总结 该研究针对多轮历史误导导致的工具调用智能体决策问题,提出可靠状态策略迁移方法,构建配对基准bench,在Qwen3模型上实现了优于多种基线的工具使用准确率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.05628 2026-08-07 cs.AI 新提交 79%

SkillHEX: Improving Agent Skills via Hypothesis-Driven Autonomous Exploration and Exploitation

SkillHEX:通过假设驱动的自主探索与利用提升智能体技能

Yuru Feng, Yaoqi Chen, Beidi Zhao, Qianxi Zhang, Xinjiang Wang, Jianan Lu, Zhirui Wang, Shusen Xu, Zengzhong Li, Qi Chen

专题命中 工具调用 :agent(title,abstract);分类 cs.AI

AI总结 SkillHEX是结合假设驱动自验证与证据引导树搜索的闭环框架,在SkillsBench87个任务上,5次迭代预算下用GPT-5.3-Codex和Claude Opus 4.7分别获55.9%、57.9%平均通过率,优于现有自演化方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.03403 2026-08-05 cs.AI 新提交 79%

Towards Robust Tool Use in Agents via Experience-Driven Adaptive Guidance

通过经验驱动的自适应指导实现智能体的鲁棒工具使用

Can Wang, Haoran Chen, Li Yu, Ding Hao, Bohai Zhao, Zhaoyang Liu, Zhiying Tu

专题命中 工具调用 :tool use(title,abstract);分类 cs.AI

AI总结 本研究针对智能体工具使用鲁棒性不足的问题,提出ExpG机制,经实验验证其可提升多类工具任务性能,还能让小模型智能体超越未用该机制的大模型智能体。

Comments Preprint.14 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.03169 2026-08-05 cs.CR cs.SE 新提交 79%

Test-time reasoning effort and unauthorized tool use in language-model agents: a prespecified equivalence study

语言模型智能体的测试时推理工作量与未授权工具使用:一项预先指定的等效性研究

Xiaonan Xu, Wenjing Wu

专题命中 工具调用 :tool use(title,abstract);分类 cs.SE

AI总结 该研究在GPT-5.6上开展预先指定的等效性研究,发现调整推理工作量未导致未授权工具使用,且规则探测率上升的模式与针对性搜索假设不符。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.02698 2026-08-05 cs.CR cs.AI 新提交 79%

Steganalysis of Adaptive Covert Collusion in Tool-Using Agent Populations: A Black-Box, Cross-Principal Approach

使用工具的智能体群体中自适应隐式合谋的隐写分析:一种黑盒跨主体方法

Mohamed Chahine Ghanem

机构 * Keele University(基尔大学)

专题命中 工具调用 :agent(title,abstract);分类 cs.AI

AI总结 本研究针对使用工具的LLM智能体群体的自适应隐式合谋,构建结合多类方法的黑盒隐写分析检测器,开展红蓝对抗实验,绘制检测容量边界并发现新的规避手段。

Comments 10 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.02569 2026-08-04 cs.AI cs.DC cs.OS 新提交 79%

AtumAI: A Principled Framework for Agentic Generation of Datacenter Control-Plane Policies

AtumAI:一种用于智能体生成数据中心控制平面策略的原则性框架

Qiushi Lin, Chaojie Zhang, Íñigo Goiri, Aditya Akella, Ricardo Bianchini, Jovan Stojkovic

专题命中 工具调用 :agentic(title,abstract);分类 cs.AI

AI总结 AtumAI是一种用于智能体生成数据中心控制平面策略的框架,通过任务编译器和进化设计循环实现形式化、可迁移、系统化的策略生成,其生成的策略在三类任务上均优于专家基线。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.29175 2026-08-03 cs.SE 新提交 79%

Execution-First Synthetic Tool-Use Trace Generation for LLM Agents

面向LLM智能体的优先执行式合成工具使用轨迹生成

Hafsa Ouajdi, Francesco Giannuzzo, Alaa Boukhary, Paolo Papotti, Gerard Conangla, Adam Elwood

专题命中 工具调用 :tool-use(title);agentic(abstract);分类 cs.SE

AI总结 针对传统数据合成的局限,提出优先执行式框架SyntheticAgentTraceQA生成工具增强型智能体的监督数据,经四工具生态系统及Qwen模型验证,该框架可提升工具执行等性能,且揭示了掩码与全监督的权衡。

详情

展开后加载摘要…

URL PDF HTML 收藏