arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

AI Agent

智能体、工具调用、规划、工作流、多智能体和自主任务执行。

共收录 518 信号源:cs.AI, cs.CL, cs.LG, cs.SE

1. 工具调用 518 篇

2606.31665 2026-07-01 cs.MA 新提交 82%

ForecastAgentSearch: Towards a Multi-Expert Agent Search System for Geopolitical Event Forecasting

ForecastAgentSearch:面向地缘政治事件预测的多专家智能体搜索系统

Miaomiao Cai, He Chang, Yunshan Ma, See-kiong Ng

专题命中 工具调用 :agent(title,abstract);multi-agent(abstract)

AI总结 提出ForecastAgentSearch框架,将地缘政治事件预测建模为多专家智能体搜索问题,通过检索、排序和协调专业智能体生成预测,并讨论关键设计挑战与评估方案。

Journal ref SIGIR 2026 AgentSearch Workshop

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.31504 2026-07-01 cs.CV 新提交 82%

SimpleSearch-VL: A Simple Recipe for Multimodal Agentic Deep Search

SimpleSearch-VL:多模态智能深度搜索的简单配方

Ming Dai, Zhihong Lu, Jinjie Gu, Jiedong Zhuang, Yefeng Liu, Wankou Yang, Jian Wang, Chunhua Shen

机构 * Southeast University(东南大学) Ant Group(蚂蚁集团)

专题命中 工具调用 :agentic(title,abstract);agent(abstract)

AI总结 提出SimpleSearch-VL框架,通过因子化自适应展开和证据验证推理提升多模态智能搜索的效率与可靠性,仅用少量数据即显著超越基线。

Comments Technical Report

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.16420 2026-06-16 cs.CR 新提交 82%

Transferable Self-Evolving Playbooks for Agentic Security Auditing

可迁移的自演化剧本用于智能体安全审计

Ziyue Wang, Cheuk Wang Maurice Ng, Chenchen Yu, Strick Sheng, Kaihua Qin, Liyi Zhou

专题命中 工具调用 :agentic(title);agent(abstract);tool use(abstract)

AI总结 提出EvoHunt框架,通过审计、评估和修订三个智能体循环演化空剧本,自动生成安全审计程序知识,开源演化可超越商业产品,且演化后的剧本可迁移至弱智能体提升其能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.16215 2026-06-16 cs.CL cs.AI cs.LG 新提交 82%

PACT: Privileged Trace Co-Training for Multi-Turn Tool-Use Agents

PACT: 多轮工具使用智能体的特权轨迹协同训练

Zhenbang Du, Jun Luo, Zhiwei Zheng, Xiangchi Yuan, Kejing Xia, Dachuan Shi, Qirui Jin, Qijia He, Shaofeng Zou, Yingbin Liang, Wenke Lee

机构 * Georgia Institute of Technology(佐治亚理工学院) Ohio State University(俄亥俄州立大学) University of Pennsylvania(宾夕法尼亚大学) Arizona State University(亚利桑那州立大学)

专题命中 工具调用 :tool-use(title,abstract);分类 cs.AI、cs.CL、cs.LG

AI总结 提出PACT框架,通过特权轨迹(专家轨迹)在训练时提供密集监督信号,结合轨迹条件RL和组件感知SFT损失,避免推理时依赖轨迹,显著提升多轮工具使用智能体的性能。

Comments Project page: https://zhenbangdu.github.io/pact-project-page/

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.14266 2026-06-15 physics.comp-ph 新提交 82%

Large Language Model Based Agent for Automated Discovery in Computational Physics

基于大语言模型的自动化计算物理发现智能体

Hang Lin, Chongwen Liu, Gang Yan

专题命中 工具调用 :agent(title,abstract);autonomous agent(abstract)

AI总结 提出PhyNex智能体,结合大语言模型引导搜索与领域工具,通过渐进局部搜索和知识积累,在三个物理问题上实现与人类专家相当或更优的解决方案。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.06880 2026-06-08 cs.IR 新提交 82%

Towards Retrieving Interaction Spaces for Agentic Search

面向智能体搜索的交互空间检索

Shengyao Zhuang, Yuansheng Ni, Hengxin Fun, Jimmy Lin, Xueguang Ma

专题命中 工具调用 :agentic(title,abstract);agent(abstract)

AI总结 提出RISE方法,通过BM25构建有边界的交互空间,并预处理文档支持shell式导航,在BrowseComp-Plus上以约四分之一成本达到78%准确率,优于纯shell基线。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.17099 2026-06-17 cs.SE cs.AI 新提交 82%

Software Delegation Contracts: Measuring Reviewability in AI Coding-Agent Work

软件委托合约:衡量AI编码代理工作中的可审查性

Vincent Schmalbach

机构 * Independent Researcher(独立研究员)

专题命中 工具调用 :agent(title,abstract);分类 cs.AI、cs.SE

AI总结 研究通过显式委托合约提升AI编码代理工作可审查性,实验发现合约虽不改善任务正确性,但显著提高证据充分性和降低审查歧义。

Comments 11 pages; empirical pilot study with 64 coding-agent runs and 192 blinded reviews

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.22642 2026-07-28 cs.AI cs.CL cs.LG cs.MA cs.SE 新提交 81%

CRAFT: Learn the Schema, Execute the Plan

CRAFT:学习模式,执行计划

Aakash Kolekar, Sahika Genc, Shahriar Shariat, Bunyamin Sisman, Tibor Mezi, Barbara Poblete, Shree Vandana Kachroo, Calvin Chi, Parth Parmar, Ari Singer, Prayaas Jain, Cindy Barker, Benoit Dumoulin

机构 * Amazon Advertising Foundations(亚马逊广告基金会) Amazon Web Services Agentic AI(亚马逊网络服务代理人工智能)

专题命中 工具调用 :agent(abstract);tool-use(abstract);agentic(abstract);分类 cs.AI、cs.CL、cs.LG

AI总结 研究企业编码代理将自然语言分析请求转换为可执行代码时的问题,提出两阶段训练后方法 CRAFT,先进行模式剥离的 PLAN 监督微调,再用执行形状的强化学习,评估显示其在多方面有提升并减少负担。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.23327 2026-07-07 cs.CV cs.AI 新提交 81%

VideoAgent: All-in-One Framework for Video Understanding and Editing

VideoAgent: 视频理解与编辑的全能框架

Hengji Zhou, Lingxuan Huang, Jian Wang, Bing Zhou, Si Wu, Lianghao Xia, Chao Huang

机构 * South China University of Technology(华南理工大学) The University of Hong Kong(香港大学) Snap Inc(Snap公司) Harbin Institute of Technology, Shenzhen(哈尔滨工业大学(深圳))

专题命中 工具调用 :agent(abstract);planning(abstract);agentic(abstract);multi-agent(abstract)

AI总结 提出VideoAgent,一种基于多智能体编排的全能框架,通过自动镜头创建和30多个专业编辑智能体,解决现有系统在长视频理解和多样化编辑操作上的局限,在VideoEdit基准上实现87-95%编排成功率并降低60% API成本。

Comments Preprint. Code available at https://github.com/HKUDS/VideoAgent

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.12674 2026-06-12 cs.AI 新提交 81%

Evoflux: Inference-Time Evolution of Executable Tool Workflows for Compact Agents

Evoflux: 紧凑型智能体的可执行工具工作流的推理时演化

Kushal Raj Bhandari, Ling Yue, Ching-Yun Ko, Dhaval Patel, Shaowu Pan, Pin-Yu Chen, Jianxi Gao

机构 * Rensselaer Polytechnic Institute(拉特格斯理工学院) IBM Research(IBM研究院)

专题命中 工具调用 :agent(abstract);tool use(abstract);workflow(abstract);function calling(abstract)

AI总结 提出Evoflux,一种推理时演化搜索方法,通过结构化编辑和执行反馈修复紧凑语言模型的工具工作流,将执行可行性从3%提升至17-24%,优于SFT和ReAct。

Comments Code is available at https://github.com/IBM/Evoflux

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.21316 2026-06-23 hep-ph 新提交 81%

Large Language Model-Assisted Framework for BSM Model Building

大型语言模型辅助的BSM模型构建框架

Shaikh Saad

专题命中 工具调用 :agent(summary_cn,abstract)

AI总结 提出bsm_agent框架,结合确定性物理后端与LLM聊天接口,通过自然语言指定新场量子数,自动构建可重整拉氏量、检查规范反常、导出对称性破缺条件与质量矩阵,确保结果可重复。

Comments 49 pages. Includes a Python package for BSM model building via LLM chat from user-specified particle quantum numbers. Code: https://github.com/saad-hep/bsm_agent

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.09855 2026-08-11 cs.AI cs.CL 新提交 81%

Agentic Auto-Research is Fuzz Testing

智能体自动研究即模糊测试

Yifeng He, Jicheng Wang, Yinzhe Zhao, Jiachen Liu, Hao Chen

专题命中 工具调用 :agentic(title);agent(abstract);分类 cs.AI、cs.CL

AI总结 该研究提出自主研究智能体的“生成-排序”范式存在反馈稀疏性问题,类比灰盒模糊测试,指出自动研究需具备密集进展信号与反馈导向搜索能力,强调反馈架构是自动研究的核心瓶颈。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.05987 2026-08-07 cs.AI cs.LG 新提交 81%

AgentOPSD: Recursive Self-Distillation for Agentic Reinforcement Learning

AgentOPSD:面向智能体强化学习的递归自蒸馏方法

Zi-Han Wang, Zhengxi Lu, Zhiyuan Yao, Jinyang Wu, Jie Wu, Zhengzhou Cai, Yueqing Sun, Ziang Ye, Linji Hao, Qi Gu, Xunliang Cai, Yongliang Shen, Yujiu Yang

机构 * Tsinghua University(清华大学) Zhejiang University(浙江大学) Meituan(美团)

专题命中 工具调用 :agentic(title,abstract);分类 cs.AI、cs.LG

AI总结 提出 AgentOPSD 这一无 critic 的递归自蒸馏方法,用于智能体强化学习的轮次级 credit 分配,在 ALFWorld 等数据集上优于 GRPO 等基线,在 Qwen2.5-7B 模型上实现 ALFWorld 89.1% 的成功率。

Comments Code: https://github.com/ZethWang/AgentOPSD

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.03527 2026-08-05 cs.IR cs.AI cs.CL 新提交 81%

Training Documents Reranker with Search Rubrics for Deep Research Agent

面向深度研究智能体的、基于搜索 rubrics 的训练文档重排序器

Wenhan Liu, Yu Lu, Qiaolin Xia, Hui Xu, Tong Zhao, Jian Xi, Yutao Zhu, Haijin Liang, Haibo Shi, Hao Wang, Zhicheng Dou

专题命中 工具调用 :agent(title,abstract);分类 cs.AI、cs.CL

AI总结 针对现有检索器无法满足深度研究智能体复杂信息需求的问题,提出搜索 rubrics 并训练文档重排序器 RubricRanker,在多基准上取得优于基线的性能且泛化性良好。

Comments 28 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.03222 2026-08-05 cs.SE cs.AI 新提交 81%

Fail-Fast, Restart-Smart: Early Failure Prediction and Restart for SWE Agentic Tasks

快速失败,智能重启:面向软件工程智能体任务的早期失败预测与重启

Chenyu Wang, Yunbo Lyu, Junda He, Zhou Yang, Chenxing Zhong, Yaniv Harel, David Lo

专题命中 工具调用 :agentic(title);agent(abstract);分类 cs.AI、cs.SE

AI总结 本文提出FailFast-RestartSmart两阶段控制器,可在5%假阳性率下节省14.6%-20.4%执行token,在25%假阳性率下将Qwen3.6-27B解决率从66.6%提至71.8%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.02645 2026-08-05 cs.SE cs.AI 新提交 81%

Verified Tool Calls Improve LLM Agent Reliability Under Non-Atomic Failures

经验证的工具调用可提升非原子故障下LLM智能体的可靠性

Isham Kalappurackal Mansoor, Abhishek Phadke, Pratip Rana

专题命中 工具调用 :agent(title,abstract);分类 cs.AI、cs.SE

AI总结 针对非原子故障导致LLM智能体可靠性不足的问题,提出带后置条件验证、重试前逻辑和幂等键的工具包装器,可减少重复动作并保持任务成功率,且无需修改底层LLM。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.20668 2026-07-24 cs.CL cs.AI 新提交 81%

From Agent Failures to Text Policies: What Works and What Breaks

从智能体失败到文本策略:可行与不可行之处

Jaideep Ray, Ankit Goyal

专题命中 工具调用 :agent(title,abstract);分类 cs.AI、cs.CL

AI总结 研究智能体中TextGrad应用问题,通过区分遵循与学习策略能力来研究。发现两者有差距,人工编写策略能提升智能体表现,而从轨迹生成的策略无法可靠超越固定提示,主要挑战是从经验中生成和选择策略。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.18308 2026-07-22 cs.LG cs.AI 新提交 81%

Agentic Calibration of Grey-Box Simulation Models: An LLM-Driven Alternative

灰箱仿真模型的智能校准:一种由大语言模型驱动的替代方法

David Gómez-Guillén, Mireia Diaz, Josep Lluis Arcos, Jesús Cerquides

机构 * Catalan Institute of Oncology-IDIBELL(加泰罗尼亚肿瘤研究所-IDIBELL) Autonomous University of Barcelona(巴塞罗那自治大学) Centro de Investigación Biomédica en Red de Epidemiología y Salud Pública(国家公共卫生与流行病学网络生物医学研究中心) Artificial Intelligence Research Institute, IIIA-CSIC(人工智能研究所,西班牙科学研究委员会-人工智能研究所)

专题命中 工具调用 :agentic(title,abstract);分类 cs.AI、cs.LG

AI总结 研究灰箱仿真模型校准问题,提出用大语言模型作优化器的智能校准方法,在肛门癌仿真模型上评估,结果表明该方法在减少模型评估次数上有优势,虽迭代推理时间增加,但可审计和解释,适用于仿真时间占主导的情况。

Comments Manuscript: 19 pages, 2 figures. Appendix: 11 pages, 1 figure

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.06854 2026-07-09 cs.LG cs.AI cs.GT 新提交 81%

A Gold-Standard Study of What Makes a Lightweight Game-Playing Agent Strong

关于使轻量级博弈代理强大的因素的金标准研究

Nima Kelidari, Mohammadsaeed Haghi, Mahdi Salmani

机构 * University of Southern California(美国南加州大学)

专题命中 工具调用 :agent(title,abstract);分类 cs.AI、cs.LG

AI总结 研究不完美信息纸牌游戏中使轻量级博弈代理强大的因素,构建专家代理作标准,经超百次运行确定有效因素,添加基线并应用于另一游戏,得出通用方法可训练有竞争力代理且无需专家训练。

Comments 9 pages, 5 figures, 3 tables. Code and models: https://github.com/Nikelroid/adversarial-coevolution

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.03333 2026-07-07 cs.DC cs.AI cs.LG 新提交 81%

SPORK: Self-Speculative Forking to Accelerate Agentic LLM Inference

SPORK:自我推测性分叉以加速智能体大语言模型推理

Huajun Bai, Weiwei Lv, Huichuan Zheng, Youyou Lu, Jiwu Shu

机构 * Tsinghua University(清华大学) Meituan(美团)

专题命中 工具调用 :agentic(title);workflow(abstract);分类 cs.AI、cs.LG

AI总结 研究LLM智能体推理中串行循环耗时问题,提出SPORK方法,利用模型自身预测提前调度推测工具调用,通过成本模型等组件优化,大幅提升推理效率且不影响任务准确性。

Comments 16 pages, 15 figures. Code: https://github.com/baihuajun24/spork

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.00297 2026-07-02 cs.LG cs.CL 新提交 81%

EPC: A Standardized Protocol for Measuring Evaluator Preference Dynamics in LLM Agent Systems

EPC:一种用于测量LLM智能体系统中评估者偏好动态的标准协议

Zewen Liu

专题命中 工具调用 :agent(title,abstract);分类 cs.CL、cs.LG

AI总结 提出EPC协议,通过四阶段隔离范式标准化测量LLM智能体系统中评估者偏好耦合现象,并提供参考快照和版本约定以支持复现、比较和衰减检测。

Comments 10 pages, 3 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.25819 2026-06-25 cs.CL cs.SE 新提交 81%

Beyond Function Calling: Benchmarking Tool-Using Agents under Tool-Environment Unreliability

超越函数调用:工具环境不可靠性下的工具使用智能体基准测试

Yang Tian, Zhengpeng Shi, Yu Zhou, Bo Zhao

机构 * School of AI, Shanghai Jiao Tong University(上海交通大学人工智能学院)

专题命中 工具调用 :function calling(title);tool-use(abstract);分类 cs.CL、cs.SE

AI总结 提出ToolBench-X基准,在工具环境中注入五种可恢复可靠性风险,评估智能体任务完成能力,发现可靠工具下表现良好的智能体在可恢复风险下失败,失败主因是诊断和恢复能力不足。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.13662 2026-06-15 cs.AI cs.CL 新提交 81%

EurekAgent: Agent Environment Engineering is All You Need For Autonomous Scientific Discovery

EurekAgent:自主科学发现中,智能体环境工程即一切

Amy Xin, Jiening Siow, Junjie Wang, Zijun Yao, Fanjin Zhang, Jian Song, Lei Hou, Juanzi Li

机构 * Department of Computer Science and Technology, Tsinghua University(清华大学计算机科学与技术系) Zhipu AI(智谱AI)

专题命中 工具调用 :agent(title,abstract);分类 cs.AI、cs.CL

AI总结 提出环境工程框架EurekAgent,通过权限、工件、预算和人机交互四维工程设计,在数学、内核工程和机器学习任务上取得新最优结果,总API成本低于11美元。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.08696 2026-06-09 cs.LG cs.AI 新提交 81%

Agentic Search for Counterfactual Recourse under Fixed LLM Budgets

固定LLM预算下的反事实追索的智能搜索

Yasuo Tabei

机构 * RIKEN Center for Advanced Intelligence Project(日本RIKEN高级智能项目中心)

专题命中 工具调用 :agentic(title,abstract);分类 cs.AI、cs.LG

AI总结 提出Comp-MCTS框架,在固定LLM调用预算下,通过树搜索最大化生成唯一且经oracle验证的反事实,平衡数量与质量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.21553 2026-06-23 cs.CL cs.IR 新提交 80%

Dissecting Agentic RAG: A Component Ablation for Multi-Hop QA with a Local 7B Model

解析智能体RAG:基于本地7B模型的多跳问答组件消融研究

Sheroz Shaikh

机构 * Independent Researcher(独立研究员)

专题命中 工具调用 :agentic(title,abstract);分类 cs.CL

AI总结 通过消融实验,发现固定混合检索和短检索循环对多跳问答贡献最大,自适应路由和深度循环并非必要。

Comments 8 pages, 4 figures, 4 tables. Code: https://github.com/sherozshaikh/agentic-rag-eval

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.28055 2026-07-31 cs.IR 新提交 80%

VIG-RL: Learning to Search and Insert for Verified Image Grounding

VIG-RL:学习搜索与插入以实现可验证的图像定位

Qinhan Yu, Jun Guang, Chong Chen, Wentao Zhang

专题命中 工具调用 :agent(abstract);autonomous agent(abstract);workflow(abstract);agentic(abstract)

AI总结 本文针对现有检索增强框架无法动态推理视觉证据插入时机与位置的问题,提出自主智能体框架VIG-RL,将相关工作流建模为主动决策过程,经强化学习优化后实现SOTA性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.15877 2026-08-18 cs.AI 新提交 79%

Dear Algo: A Precision-First Agentic Intent Layer for Unified Search and Recommendation

Dear Algo:面向统一搜索与推荐的精准优先智能体意图层

Rui Wang, Jiazhou Wang, Zheng Wei, Chenglin Lu, Fangcheng Sun, Ivy Sun, Jin Sun, Hui Geng, Lillian Zhang, Chao Yang, Lei Chen, Shahin Sefati, Reem Helou, Joe Zhou, Babak Shakibi, Yiyi Pan, Bi Xue, Hong Yan, Shujian Bu

机构 * Meta Platforms Inc.(元平台公司) Google DeepMind(谷歌DeepMind)

专题命中 工具调用 :agentic(title,abstract);分类 cs.AI

AI总结 该研究提出面向统一搜索与推荐的精准优先智能体意图层Dear Algo,将多类型意图编译为可执行计划,实验显示其在精度、候选数量及用户相关性上均优于基线。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.09622 2026-08-11 cs.AI cs.SY eess.SY 新提交 79%

Adaptive Sequential Test Planning for Multi-Mechanism Reliability Qualification via Bayesian Monte Carlo Tree Search

基于贝叶斯蒙特卡洛树搜索的多机制可靠性鉴定自适应序贯测试规划

Youssef A. Elhagrasy, Ian Hill, André Ivanov

机构 * University of British Columbia(英属哥伦比亚大学)

专题命中 工具调用 :planning(title,abstract);分类 cs.AI

AI总结 该研究针对多机制半导体可靠性鉴定,提出结合MCTS-SA与EKF的闭环自适应序贯测试规划框架,实验显示其表征良率较非自适应策略大幅提升。

Comments Accepted to IEEE Transactions on Reliability

Journal ref IEEE Transactions on Reliability, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.09577 2026-08-11 cs.AI 新提交 79%

ElasticBack: Stealthy Conditional Backdoor in LLM-Agent Skills via Coupled Trigger-Rule Optimization

ElasticBack:通过耦合触发-规则优化实现LLM智能体技能中的隐蔽条件后门

Hao Sui, Simeng Qin, Jie Liao, Xiaojun Jia, Bing Chen, Yang Liu

专题命中 工具调用 :agent(title,abstract);分类 cs.AI

AI总结 本研究提出ElasticBack,通过耦合触发-规则优化在LLM智能体技能中植入条件性单技能后门,实验显示其攻击性能优异且隐蔽性强,可推动技能供应链的防御研究。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.08700 2026-08-11 cs.AI 新提交 79%

PluginEval: A Diagnostic Benchmark for Fine-Grained Error Attribution in Function Calling

PluginEval:用于函数调用细粒度错误归因的诊断基准

Dongjie Xu, Julius, Hanchi Dong, Minghua Tang, Yuxuan Sun, Ziwei Nie, Zicheng Liu, Dujun Qing, Jiajie Xu

专题命中 工具调用 :function calling(title);autonomous agent(abstract);分类 cs.AI

AI总结 PluginEval是缓解现有函数调用基准局限的两阶段诊断基准,可细粒度归因错误,评估显示不同模型在难度级别和错误类别中存在性能差异,且其LLM判断器与人类标注一致性良好。

详情

展开后加载摘要…

URL PDF HTML 收藏