arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

AI Agent

智能体、工具调用、规划、工作流、多智能体和自主任务执行。

共收录 7434 信号源:cs.AI, cs.CL, cs.LG, cs.SE

1. 工具调用 569 篇

2606.14239 2026-06-15 cs.AI 新提交 57%

SkillAudit: Ground-Truth-Free Skill Evolution via Paired Trajectory Auditing

SkillAudit: 通过配对轨迹审计实现无真实反馈的技能进化

Haowen Gao, Haoran Chen, Can Wang, Shasha Guo, Liang Pang, Zhaoyang Liu, Huawei Shen, Xueqi Cheng

机构 * State Key Laboratory of AI Safety, Institute of Computing Technology, CAS(中国科学院计算技术研究所人工智能安全国家重点实验室) University of Chinese Academy of Sciences(中国科学院大学) Tongyi Lab, Alibaba Group(阿里巴巴集团通义实验室)

专题命中 工具调用 :agent(abstract);分类 cs.AI

AI总结 提出SkillAudit框架,通过配对轨迹审计和过程对齐对比评估,无需真实反馈即可进化智能体技能,在89个任务中平均奖励达73.9%。

Comments 20 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.13940 2026-06-15 cs.CL 新提交 57%

Can Post-Training Turn LLMs into Good Medical Coders? An Empirical Study of Generative ICD Coding

后训练能否使LLM成为优秀的医学编码员?生成式ICD编码的实证研究

Ziqing Wang, Weihao Li, Shijie Chen, Yuan Luo, Kaize Ding

机构 * Northwestern University(西北大学)

专题命中 工具调用 :tool use(abstract);分类 cs.CL

AI总结 通过对比提示、监督微调和强化学习(GRPO及新提出的PHI课程)在ICD编码任务上的表现,发现后训练(尤其是SFT和GRPO)能显著提升生成式LLM的编码性能,提示评估瓶颈在于模型适应而非生成范式本身。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.13859 2026-06-15 cond-mat.mtrl-sci cs.LG 新提交 57%

Closed-loop discovery of out-of-distribution processing protocols by evolutionary search and uncertainty-aware learning

通过进化搜索和不确定性感知学习发现分布外处理协议的闭环方法

Yu Liu, Stanislav Udovenko, Ching-Che Lin, Jaegyu Kim, Lane W. Martin, Susan Trolier-McKinstry, Sergei V. Kalinin

机构 * Department of Materials Science and Engineering, University of Tennessee, Knoxville(田纳西大学材料科学与工程系) Materials Science and Engineering Department, Materials Research Institute, the Pennsylvania State University(宾夕法尼亚州立大学材料研究学院材料科学与工程系) Department of Materials Science and NanoEngineering, Rice University(Rice大学材料科学与纳米工程系) Rice Advanced Materials Institute, Rice University(Rice大学先进材料研究所) Department of Materials Science and Engineering, University of California, Berkeley(加州大学伯克利分校材料科学与工程系) Departments of Chemistry and Physics and Astronomy, Rice University(Rice大学化学与天文物理系) Physical Sciences Division, Pacific Northwest National Laboratory(太平洋西北国家实验室物理科学部)

专题命中 工具调用 :workflow(abstract);分类 cs.LG

AI总结 提出一种闭环工作流,结合紧凑波形表示的进化搜索与不确定性感知深度核学习,自动发现提升铁电薄膜非线性响应的分布外处理协议,并通过实验验证其机制。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.13663 2026-06-12 cs.CL 新提交 57%

HyperTool: Beyond Step-Wise Tool Calls for Tool-Augmented Agents

HyperTool:超越逐步工具调用的工具增强型智能体

Yaxin Du, Yifan Zhou, Yujie Ge, Jiajun Wang, Xianghe Pang, Shuo Tang, Tuney Zheng, Bryan Dai, Jian Yang, Siheng Chen

机构 * Shanghai Jiao Tong University(上海交通大学) IQuest Research Beijing University of Aeronautics and Astronautics(北京航空航天大学)

专题命中 工具调用 :tool use(abstract);分类 cs.CL

AI总结 针对工具增强型LLM中逐步调用导致执行粒度不匹配的问题,提出HyperTool统一可执行接口,将确定性工具子流程折叠为单次调用,在多步工具任务上显著提升准确率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.13120 2026-06-12 cs.CL 新提交 57%

EvoBrowseComp: Benchmarking Search Agents on Evolving Knowledge

EvoBrowseComp: 基于演化知识的搜索智能体基准测试

Yunhan Wang, Jiaan Wang, Lianzhe Huang, Xianfeng Zeng, Fandong Meng

机构 * Northeastern University, China(东北大学(中国)) Weixin AI, Tencent Inc, China(腾讯微信AI(中国))

专题命中 工具调用 :agent(abstract);分类 cs.CL

AI总结 提出EvoBrowseComp,一个通过实时网络遍历自动生成400道英文和400道中文无污染复杂问题的演化基准,用于评估搜索智能体在动态知识环境中的真实浏览能力。

Comments 14 pages, under review

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.12908 2026-06-12 cs.CL 新提交 57%

SENTINEL: Failure-Driven Reinforcement Learning for Training Tool-Using Language Model Agents

SENTINEL: 用于训练工具使用语言模型智能体的失败驱动强化学习

Ziyi Wang, Yuxuan Lu, Yimeng Zhang, Qun Liu, Chen Luo, Jiri Gesi, Hanqing Lu, Yisi Sang, Manling Li, Jing Huang, Dakuo Wang

机构 * Northeastern University(东北大学) Independent Researcher(独立研究员) Northwestern University(西北大学)

专题命中 工具调用 :tool use(abstract);分类 cs.CL

AI总结 提出SENTINEL框架,通过将智能体失败转化为针对性训练任务,在Tau2-Bench Retail上提升Qwen3-4B模型Pass@1从66.4到74.9,优于通用合成任务上的强化学习。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.11806 2026-06-11 cs.CL 新提交 57%

External Experience Serving in Production LLM Systems: A Deployment-Oriented Study of Quality-Cost Trade-offs

生产级LLM系统中的外部经验服务:面向部署的质量-成本权衡研究

Lin Sun, Heming Zhang, Xiangzheng Zhang

机构 * Qiyuan Tech(奇元科技)

专题命中 工具调用 :tool-use(abstract);分类 cs.CL

AI总结 研究生产级LLM系统中注入外部经验的质量-成本权衡,发现选择性检索优于全局注入,且检索质量比增加Top-K更重要,成本效益因任务输出长度而异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.11662 2026-06-11 cs.AI 新提交 57%

TreeSeeker: Tree-Structured Trial, Error, and Return in Deep Search

TreeSeeker:深度搜索中的树结构试错与回溯

Zhuofan Shi, Mingzhe Ma, Lu Wang, Fangkai Yang, Pu Zhao, Yiming Guan, Youling Huang, Wei Zhang, Qingwei Lin, Dongmei Zhang, Saravan Rajmohan

机构 * Microsoft(微软公司) East China Normal University(东华大学)

专题命中 工具调用 :agent(abstract);分类 cs.AI

AI总结 提出TreeSeeker框架,通过树结构分支-回溯搜索和UCB信号选择,在深度搜索中实现受控试错,显著提升复杂问答性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.09863 2026-06-10 cs.LG 新提交 57%

From Confident Closing to Silent Failure: Characterizing False Success in LLM Agents

从自信收尾到无声失败:LLM智能体中的虚假成功特征分析

Laksh Advani

机构 * Laksh Advani

专题命中 工具调用 :agent(abstract);分类 cs.LG

AI总结 研究LLM智能体在环境状态未完成时声称任务完成的虚假成功模式,发现其普遍存在但检测困难,轻量级TF-IDF检测器优于LLM评判器。

Comments Accepted to FAGEN@ICML2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.09062 2026-06-09 cs.CR cs.SE 新提交 57%

Security-First Approach to API Pipeline Development with Zero-Trust Architecture

基于零信任架构的API管道开发安全优先方法

Mahima Agarwal, Keshav Ranjan

专题命中 工具调用 :planning(abstract);分类 cs.SE

AI总结 针对API攻击激增和漏洞利用加速的现状,提出一种结合零信任架构和DevSecOps的五支柱安全优先框架,通过治理、设计、测试、管道控制和运行时防护,显著减少安全事件和发布后漏洞。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.07709 2026-06-09 cs.SE 新提交 57%

Are We Lost in the Woods? Detecting Silent Semantic Faults for Random Forest Classifiers with Data-informed Static Analysis

我们是否迷失在森林中?通过数据驱动的静态分析检测随机森林分类器的静默语义故障

Willem Meijer, Louis Ohl, Kristian Sandahl, Daniel Varro

专题命中 工具调用 :agentic(abstract);分类 cs.SE

AI总结 提出一种数据驱动的静态分析技术,通过提取ML流水线为有向无环图并对照形式化API契约评估,以检测随机森林分类器中的静默语义故障,实现高精度(91%)和亚秒级运行时开销。

Comments 11 pages + 2 pages with references, 4 figures, 3 tables, 2 code listings

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.26122 2026-06-26 cs.CV 新提交 56%

DocArena: Turning Raw Documents into Controllable Training Environments for Document Search Agents

DocArena:将原始文档转化为可控的训练环境用于文档搜索代理

Jiamian Wang, Ruiyi Zhang, Tong Yu, Jing Shi, Samyadeep Basu, Rajiv Jain, Zhiqiang Tao, Tong Sun

机构 * Rochester Institute of Technology(罗切斯特理工学院) Adobe Research(Adobe研究院)

专题命中 工具调用 :agent(abstract,comments)

AI总结 提出DocArena自动化流程,通过多模态文档结构化、推理型QA对构建和质量控制,生成可控训练环境,使基于文本LLM的搜索代理在多模态文档检索和问答中取得最佳性能。

Comments search agent for documents

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.26314 2026-08-28 cs.RO math.OC 新提交 50%

Dispersive Forward Tree Search for Optimal Control: Coverage, Complexity, and Computation

用于最优控制的分散式前向树搜索:覆盖性、复杂度与计算

Shashank A. Deshpande, Jonathan P. How

机构 * Massachusetts Institute of Technology(麻省理工学院)

专题命中 工具调用 :planning(abstract)

AI总结 本文针对非线性平台的规划问题,提出具有有限样本近最优性保证的DFT*算法,通过分散指令集与代价剪枝,在嵌入式处理器上实现高效实时规划,性能优于现有运动学动力学规划器。

Comments 28 pages. Code: https://github.com/croshank/DFTSearch

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.22862 2026-08-25 cs.NE 新提交 50%

JANUS: Online Jacobian-Aligned Infill for Black-Box Optimization

JANUS:用于黑箱优化的在线雅可比对齐填充

Hongyuan Yu, Pufan Xu, Jiaojiao Yi, Yiding Tian, Mingrui Sun, Jiayuan Lu, Changyuan Wen

专题命中 工具调用 :planning(abstract)

AI总结 JANUS是即插即用的黑箱优化填充模块,实时估计局部雅可比引导搜索,提升了CMA-ES等宿主优化器在BBOB、多目标等任务上的性能,无需离线训练。

Comments 27 pages, BBO method

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.22036 2026-08-25 cs.IR 新提交 50%

SARCLIP: A Scalable CLIP-Based Retrieval System for Seventeenth-Century Spanish American Notary Records

SARCLIP:用于17世纪西班牙美洲公证记录的可扩展CLIP检索系统

Chandrasekhar Syamala, Parshad Suthar, Hulayyil Alshammari, Viviana Grieco, Praveen Rao

专题命中 工具调用 :workflow(abstract)

AI总结 该研究针对历史手稿档案检索难题,构建了基于CLIP的SARCLIP系统,结合FAISS索引、伪相关反馈等人在回路功能,可在大规模17世纪西班牙美洲公证记录语料库上实现完整交互式检索。

Comments 4 pages, 2 figures. To appear

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.21469 2026-08-25 cs.CR 新提交 50%

Scalable PII Discovery in Mobile App Databases via Hypothesis-Driven Search

基于假设驱动搜索的移动应用数据库中可扩展个人身份信息(PII)发现

Jeel Piyushkumar Khatiwala, Samad Afolabi, Ruoyao Xiao, Yu Luo, Dianxiang Xu, Weifeng Xu

专题命中 工具调用 :agent(abstract)

AI总结 该研究针对移动应用数据库中PII发现的难题,提出假设驱动框架,在25个SQLite数据库上验证,Gemini 2.5 Pro取得94.5% F1,可缩减79.9%有效搜索空间,且模型性能受其能力影响显著。

Comments X pages, Y figures. Accepted at IDFC 2026 (Trento, Italy). To appear in Frontiers in Artificial Intelligence and Applications, IOS Press

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.22271 2026-08-25 cs.FL math.LO 新提交 50%

Exact versus unique nondeterministic automatic complexity

精确非确定性自动机复杂度与唯一非确定性自动机复杂度

Bjørn Kjos-Hanssen, Travis Rivera Petit

专题命中 工具调用 :agent(abstract)

AI总结 该研究证明精确非确定性自动机复杂度$A_{Ne}$与唯一非确定性自动机复杂度$A_N$存在差异,找到二进制分离单词w,经穷举搜索和SAT求解器验证,分离结果由AI智能体发现。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.23270 2026-08-25 astro-ph.IM astro-ph.HE 新提交 50%

AI-Assisted Extraction of Follow-up Observations from GCN Circulars in Astro-COLIBRI

AI辅助从Astro-COLIBRI中的GCN Circulars提取后续观测数据

Fabian Schüssler, S. Bisero, M. Cellier, A. Ciric, B. Cornejo, I. Jaroschewski, A. Kaan Alkan, W. Kiendrébéogo, A. Saint-Paul

专题命中 工具调用 :workflow(abstract)

AI总结 该研究开发了Astro-COLIBRI的AI辅助组件,可将GCN Circulars转换为结构化后续记录,经评估准确率达99.80%,已实时处理新Circulars并发布开源解析管道。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.19933 2026-08-21 cond-mat.mtrl-sci 新提交 50%

Building atomistic models of heterointerfaces with optimal transport

基于最优传输构建异质界面的原子模型

Yuxuan Tang, Keith T. Butler

专题命中 工具调用 :workflow(abstract)

AI总结 本文提出融合格罗莫夫-瓦瑟斯坦(FGW)距离结合贝叶斯优化的工作流,构建异质界面原子模型,可高效筛选界面晶格匹配关系,性能优于随机搜索及预训练MACE能量引导方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.18673 2026-08-20 cs.CV 新提交 50%

DynCur-Geo: Dynamic Curiosity Reward Shaping for Multimodal Active Geo-Localization

DynCur-Geo:面向多模态主动地理定位的动态好奇心奖励塑造

Yiming Sun, Yang Zhang, Pengfei Zhu

专题命中 工具调用 :agent(abstract)

AI总结 本文提出DynCur-Geo动态好奇心框架,通过距离感知门与势能奖励塑造优化多模态主动地理定位,在多场景实验中较基线方法取得一致性能提升。

Comments 24 pages, 18 figures, 15 tables. The main paper is 7 pages, with supplementary material included

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.18454 2026-08-20 cs.RO 新提交 50%

Backward Layout Search for Sequence-Constrained Robotic Assembly

面向序列约束机器人装配的反向布局搜索

Xi Zhang, Jiancong Dai, Hao Chen, Zhengtao Hu, Changcai Yang, Weiwei Wan

机构 * College of Computer and Information Sciences, Fujian Agriculture and Forestry University(福建农林大学计算机与信息学院) School of Mechatronic Engineering and Automation, Shanghai University(上海大学机电工程与自动化学院) Department of System Innovation, Graduate School of Engineering Science, Osaka University(大阪大学工程科学研究生院系统创新系)

专题命中 工具调用 :planning(abstract)

AI总结 针对序列约束机器人装配布局规划的挑战,提出反向布局搜索(BLS)算法,通过反向分配零件初始位姿并结合多维度检查与波束选择,在5个装配模型上实现了更优的无碰撞布局规划,减少了评估次数与搜索时间。

Comments Submit to ROBIO2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.18309 2026-08-20 cs.CV 新提交 50%

XRF-to-Optical Field-of-View Localization with Vision Language Models

基于视觉语言模型的X射线荧光(XRF)与光学显微镜视场(FOV)定位

Xiangyu Yin, Tatjana Paunesku, Letonia Copeland-Hardin, Martina Ralle, Zichao Wendy Di, Si Chen, Gayle E. Woloschak, Barry Lai, Mathew J. Cherukara, Stefan Vogt

机构 * Northwestern University(西北大学) University of Chicago(芝加哥大学) Oregon Health and Science University(俄勒冈健康与科学大学) Argonne National Laboratory(阿贡国家实验室)

专题命中 工具调用 :workflow(abstract)

AI总结 本文针对跨模态显微图像的视场定位难题,提出结合视觉语言模型(VLM)的候选生成-验证工作流,在低对应度的相邻切片成像数据中实现了有效定位,为关联XRF与光学显微测量提供了支撑。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.19008 2026-08-20 physics.ao-ph 新提交 50%

Extremes on Rewind: Generating 1,000-Member Ensembles Initialized at a Final Condition

回溯极端事件:在最终状态条件下初始化生成1000成员集合

Jerry Lin, Mu-Ting Chien, Mansi Sakarvadia, Elizabeth A. Barnes

专题命中 工具调用 :planning(abstract)

AI总结 本研究使用非自回归基础模型cBottle-video生成1000成员集合,针对三个极端事件验证了终点约束集合的多样性与有效性,为罕见高影响事件的情景规划提供了高效方案。

Comments 38 pages, 21 figures; includes 17 pages of Supporting Information with 15 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.17446 2026-08-19 econ.TH 新提交 50%

Searchable Menus

可搜索菜单

Frank Yang, Piotr Dworczak

专题命中 工具调用 :agent(abstract)

AI总结 本文研究代理人视角下受可处理性约束的最优筛选机制,提出可搜索菜单要求,在多产品垄断等不同场景推导最优可搜索菜单形式,得出多维筛选中可搜索性限制可实施结果集合的结论。

Comments 83 pages, 1 figure

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.16041 2026-08-18 cs.RO 新提交 50%

ScenarioCharacterization: A Modular Toolkit for Characterizing Safety across Trajectory Datasets

ScenarioCharacterization:用于刻画轨迹数据集安全性的模块化工具包

Ingrid Navarro, Yutong Duan, Jonathan Francis, Jean Oh

机构 * Robotics Institute, School of Computer Science, Carnegie Mellon University(卡内基梅隆大学计算机学院机器人研究所) Stack AV Bosch Center for Artificial Intelligence(博世人工智能中心)

专题命中 工具调用 :agent(abstract)

AI总结 本文提出开源模块化框架ScenarioCharacterization,可自动刻画轨迹数据集的驾驶场景安全性,适配多数据集,在Waymo等数据集上验证,支持下游应用。

Comments 9 pages, 7 figures, 3 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.12872 2026-08-14 eess.SP 新提交 50%

Efficient and Accurate Surrogate-Assisted Electromagnetic Parameter Calibration for 6G Digital Twin Channels

面向6G数字孪生信道的高效高精度代理辅助电磁参数校准方法

Xiaofan Zou, Pan Tang, Peijie Liu, Changyou Tai

专题命中 工具调用 :workflow(abstract)

AI总结 针对6G数字孪生信道电磁参数校准的效率与精度瓶颈,提出SGWO-IM算法,通过代理模型预筛选与优化策略,使RT仿真调用量降62.5%、RMSE降至2.97 dB,实现效率与精度的平衡。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.12039 2026-08-13 cs.DM 新提交 50%

Search and Rescue on the Plane

平面上的搜索与救援问题

Jared Coleman, Evangelos Kranakis, Danny Krizanc, Oscar Morales-Ponce

专题命中 工具调用 :agent(abstract)

AI总结 该研究针对平面搜索与救援问题,确定临界角$\theta^* \approx 15.6^\circ$,据此给出不同角度下智能体的最优检查点,推导竞争比闭式表达式,优化搜索与交付的竞争性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.09993 2026-08-12 eess.IV cs.CV 新提交 50%

APCReg: Anatomical-Prior-Guided Coarse-to-Fine CBCT--IOS Registration via Multi-View Projection and Reliability-Controlled Residual Correction

APCReg:基于解剖先验的、经多视图投影与可靠性控制残差校正的CBCT与口腔内扫描(IOS)粗到精配准方法

Xincan Zheng, Yaqi Wang, Zhi Li, Jiahao Bao, Lan Feng, Yiru Xia, Shuai Wang

专题命中 工具调用 :planning(abstract)

AI总结 针对CBCT与IOS自动配准不可靠的问题,提出APCReg框架,通过多视图解剖粗配准、重叠感知残差配准及牙弓结构假设选择等技术,在60个颌骨对的评估中多项指标优于开源基线。

Comments 10 pages, 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.10281 2026-08-12 cs.CR 新提交 50%

From Prompt Injection to Web Exploitation: Revisiting Classic Vulnerabilities in LLM-Integrated Applications

从提示注入到Web漏洞利用:重新审视集成大语言模型的应用中的经典漏洞

Spiros Tsigkopoulos, Christoforos Ntantogian

专题命中 工具调用 :agentic(abstract)

AI总结 本文研究集成大语言模型的Web应用的新型攻击LLM介导的Web攻击,提出LLM2X系列攻击类型,通过实现TicketOracle实验发现模型易感性差异,给出多层缓解策略。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.09682 2026-08-11 cs.CV 新提交 50%

Thinking With Tools, Not With Pixels: Tool Calls as Text Scaffolds for Visual Reasoning

用工具思考,而非用像素思考:工具调用作为视觉推理的文本支架

Jiahao Shao, Yuanbo Yang, Yiyi Liao, Yujun Shen, Ceyuan Yang, Yinghao Xu

机构 * Hong Kong University of Science and Technology(香港科技大学) The Chinese University of Hong Kong(香港中文大学) Ant Group(蚂蚁集团) Zhejiang University(浙江大学)

专题命中 工具调用 :tool use(abstract)

AI总结 该研究提出工具调用支架假设,引入TextCall方法验证返回图像冗余,仅用结构化文本支架即可实现视觉推理,降低延迟并消除工具API调用,结论适用于现有相关基准。

详情

展开后加载摘要…

URL PDF HTML 收藏