arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

AI Agent

智能体、工具调用、规划、工作流、多智能体和自主任务执行。

2026-08-31 至 2026-08-31 共收录 20 信号源:cs.AI, cs.CL, cs.LG, cs.SE

1. 工具调用 20 篇

2608.26747 2026-08-31 cs.AI 版本更新 87%

AgentFold: Closed-Loop Agentic Search for Protein Folding Model Design

AgentFold:用于蛋白质折叠模型设计的闭环智能体搜索

Mingquan Liu, Jiangyu Chen, Hanqun Cao, Xujun Zhang, Pengsen Ma, Xiangru Tang, Shuting Jin, Zhuo Yang, Annie Zheng, Tianfan Fu, Fang Wu, Xiangxiang Zeng

机构 * Hunan University(湖南大学) Nanjing University(南京大学) The Chinese University of Hong Kong(香港中文大学) Zhejiang University(浙江大学) Yale University(耶鲁大学) Wuhan University of Science and Technology(武汉科技大学) Southeast University(东南大学) Stanford University(斯坦福大学)

专题命中 工具调用 :agentic(title);agent(abstract);tool use(abstract);planning(abstract)

AI总结 AgentFold是将蛋白质折叠模型开发转化为闭环搜索的多智能体框架,以ESMFold为起点,通过MCTS策略分配计算资源,在匹配预算下较Codex提案提升lDDT 7.5%,优于随机搜索。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.22697 2026-08-31 cs.AI econ.GN 版本更新 85%

Does Rank Still Matter? Position Bias When AI Agents Shop on Our Behalf

排名仍然重要吗?AI代理代人购物时的位置偏差

Davood Wadi, Yu Ma

专题命中 工具调用 :AI agent(title,abstract);agent(abstract);agentic(abstract);分类 cs.AI

AI总结 该研究对比四种大语言模型与人类实地数据,发现AI代理代人购物时搜索深度更高、从不弃权,列表位置对其查看影响弱且非单调,结果属性比位置更重要,最终所有模型均选相同非劣势列表。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.28439 2026-08-31 cs.CL cs.AI 新提交 84%

Fidelity Is Not Enough: Dispatch-Level Instrumentation for Agentic Datasheet Extraction

保真度并不足够:智能体数据表提取的调度级检测工具

Qing Ye, Meng-Hsuan Lin

机构 * Infineon Technologies AG(英飞凌科技股份公司)

专题命中 工具调用 :agentic(title,abstract);tool use(abstract);分类 cs.AI、cs.CL

AI总结 该研究针对智能体数据表提取,发现仅靠保真度不足,提出构建调度级工具,通过检查工具调用轨迹检测故障,验证了其对植入故障的检测能力及工具层的可移植性价值。

Comments Accepted at EMNLP 2026 Industry Track. 7 pages + appendices

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.27796 2026-08-31 cs.AI 新提交 83%

ReToolSQL: Agentic Reinforcement Learning for Robust Text-to-SQL

ReToolSQL:用于鲁棒文本到SQL的智能体强化学习

Pratik Kakkar, Chandra Dhir, Ravi Shankar, Pareekshit Reddy Gaddam, Anup Shirgaonkar

机构 * JPMorganChase(摩根大通)

专题命中 工具调用 :agentic(title,abstract);tool-use(abstract);分类 cs.AI

AI总结 ReToolSQL为文本到SQL提出两阶段训练框架,结合监督微调与智能体强化微调,在BIRD-SQL基准上取得高执行准确率,登顶单模型开发集排行榜,是实现企业级鲁棒文本到SQL的可行方案。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.27994 2026-08-31 cs.CR cs.SE 新提交 79%

Moirae: A Multimodal Agent Collaborative Framework for Dynamic Android Malware Detection

Moirae:用于动态Android恶意软件检测的多模态智能体协作框架

Xueying Zeng, Youquan Xian, Yanze Li, bowen hu, Ziqi Shan, Xu Luo, DanPing Yang, Peng Liu, Lei Cui, Bo Li

专题命中 工具调用 :agent(title,abstract);分类 cs.SE

AI总结 该研究提出多模态智能体协作框架Moirae,通过融合多维度运行时证据实现动态Android恶意软件检测,在未见过的数据集上零样本准确率达90.06%,优于现有基线且抗概念漂移。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.28532 2026-08-31 cs.NI eess.SY 新提交 78%

xTRUCE: A Provably Safe Arbiter for Multi-xApp Conflict Mitigation in Agentic O-RAN

xTRUCE:面向智能体开放式无线接入网(O-RAN)中多xApp冲突缓解的可证明安全仲裁器

Le Xia, Rose Qingyang Hu, Paul S. Kudyba, Zhenlin An, Haijian Sun

专题命中 工具调用 :agentic(title,abstract)

AI总结 针对O-RAN中LLM驱动xApp提案的冲突等问题,提出可证明安全的仲裁器xTRUCE,通过三层约束层次与两阶段仲裁机制保障gNB控制安全,经仿真和空中实验验证其有效性。

Comments 13 pages, 7 figures. This work has been submitted to the IEEE for possible publication

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.27912 2026-08-31 cs.IR 新提交 78%

ITER: Interaction-Aware Retrieval for Agentic Search

ITER:面向智能体搜索的交互感知检索

Haodong Chen, Shuai Wang, Yu Yin, Shengyao Zhuang, Guido Zuccon, Teerapong Leelanupab

专题命中 工具调用 :agentic(title);agent(abstract)

AI总结 本文提出交互感知稠密检索器ITER,利用智能体轨迹学习信号训练,在六种智能体骨干上优于LRAT,跨智能体鲁棒性强于AgentIR,在两个基准上获显著性能提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.02751 2026-08-31 cs.IR cs.AI cs.CL 版本更新 73%

Search, Inspect, Fetch: Exploiting Structure-Aware Boolean Retrieval for Deep-Search Agents

搜索、检查、获取:利用布尔检索构建深度研究智能体

Shuai Wang, Haodong Chen, Yu Yin, Shengyao Zhuang, Bevan Koopman, Guido Zuccon

机构 * The University of Queensland(昆士兰大学) CSIRO(联邦科学与工业研究组织)

专题命中 工具调用 :agent(abstract);workflow(abstract);分类 cs.AI、cs.CL

AI总结 本研究针对现有深度研究智能体的缺陷,提出基于BQL的SIEVE接口,在三个问答数据集上实现更高准确率且token用量显著减少,验证了BQL过滤的有效性。

Comments clean up text, format, clearer setup;

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.04935 2026-08-31 cs.SE cs.AI 版本更新 73%

ASA: Backbone-Training-Free Representation Engineering for Tool-Calling Agents

ASA:无需骨干训练的工具调用智能体表示工程

Youjin Wang, Run Zhou, Yingjie Ma, Rong Fu, Jiani Liang, Shuaishuai Cao, Min Huang, Tao Fang, Liangming Pan

机构 * Renmin University of China(中国人民大学) University of Macau(澳门大学) Central South University(中南大学) Jiangxi Normal University(江西师范大学) Macau Millennium College(澳门 millennium 学院) Peking University(北京大学)

专题命中 工具调用 :agent(abstract);tool-use(abstract);分类 cs.AI、cs.SE

AI总结 针对大语言模型在工具调用中的惰性代理问题,提出一种无需训练、推理时激活干预的方法ASA,通过路由条件混合引导向量和探针引导门控,显著提升工具使用F1并降低误报率。

Comments Due to an unresolved dispute among the authors regarding the correctness of the experimental results and the validity of the conclusions, the team has decided to withdraw this paper until these issues can be fully resolved

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.28447 2026-08-31 cs.AI 新提交 70%

Learning to Use Tools: Reinforcement Learning for Tool-Integrated Mathematical Reasoning

学习使用工具:用于工具集成数学推理的强化学习

Minghui Xu, Zi Wang

机构 * Stanford University(斯坦福大学)

专题命中 工具调用 :tool use(abstract);tool-use(abstract);分类 cs.AI

AI总结 本研究针对Countdown任务,构建工具使用的SFT数据集并采用多种强化学习方法,结合计算器工具集成提升LLM数学推理,使pass@1达66.0%,显著降低计算与验证错误。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.28062 2026-08-31 cs.AI 新提交 70%

WeAgent-MMSearch: Native Text-Vision Interaction for Multimodal Search Agents

WeAgent-MMSearch:面向多模态搜索智能体的原生文本-视觉交互

Zongkai Liu, Hui Zhang, Liqiang Niu, Zhen Cao, Han Li, Juntao Liu, Wenchao Chen, Chengduo Zhao, Chao Yu, Fandong Meng

机构 * Weixin AI, Tencent(腾讯微信人工智能) Sun Yat-sen University(中山大学)

专题命中 工具调用 :planning(abstract);agentic(abstract);分类 cs.AI

AI总结 针对现有多模态搜索智能体忽略图像、长程交互易失败的问题,提出 WeAgent-MMSearch 系统,通过 WeAgent-Harness 实现文本-视觉交互,经 FA-GSPO 后训练后,模型在多模态搜索基准上性能大幅提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.18414 2026-08-31 cs.CR cs.AI 版本更新 70%

Prompts Don't Protect: Architectural Enforcement via MCP Proxy for LLM Tool Access Control

提示不保护:通过MCP代理实现的架构强制以实现LLM工具访问控制

Rohith Uppala

机构 * Independent Researcher(独立研究员)

专题命中 工具调用 :agent(abstract);autonomous agent(abstract);分类 cs.AI

AI总结 本文提出了一种受控的MCP代理,通过在工具发现和工具调用两个阶段实施基于属性的访问控制(ABAC),有效阻止了未经授权的工具调用,而提示基于的限制仅能减少11-18个百分点的未授权调用率,证明了架构强制在部署的智能体系统中实现可靠工具访问控制的必要性。

Comments 7 pages, 4 tables, 2 figures. Camera-ready version accepted to the EMNLP 2026 Industry Track; adds benign-utility and abstention evaluation, latency percentiles, and revised limitations

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.27797 2026-08-31 cs.AI cs.CL cs.FL 新提交 62%

CEDAR: Automata as Verifiable Interfaces for Language-Guided Embodied Action

CEDAR:作为语言引导具身动作可验证接口的自动机

Lekai Chen, Alvaro Velasquez, Ashutosh Trivedi

机构 * University of Colorado Boulder(科罗拉多大学博尔德分校)

专题命中 工具调用 :agent(abstract);分类 cs.AI、cs.CL

AI总结 提出 CEDAR 框架,将具身智能体的自然语言指令转化为正则语言并表示为确定有限自动机,在 Minecraft 中可维持基线无法保留的时空约束并减少 LLM 查询,提供了实用的验证层。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.27750 2026-08-31 cs.LG cs.CL 新提交 62%

The Calls are Coming from Inside the Model: Investigating Probe-based Detection of Tool-Calling Errors in LLMs

调用来自模型内部:研究基于探针的大型语言模型工具调用错误检测方法

Eric Yeats, Brendan Kennedy, Loc Truong, John Buckheit, Jung Lee, Jesse Friedbaum, John Emanuello, Henry Kvinge

机构 * Pacific Northwest National Laboratory(太平洋西北国家实验室) National Security Agency(美国国家安全局)

专题命中 工具调用 :function calling(abstract);分类 cs.CL、cs.LG

AI总结 本研究探究基于线性探针的工具调用错误检测方法,在18个工具调用LLM上验证其效能,发现探针可捕捉多种工具调用错误,还能泛化到新型错误,为LLM工具调用错误检测提供有效手段。

Comments 4 main pages, 8 pages of references and appendices

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.19423 2026-08-31 cs.CR cs.AI cs.LG 版本更新 62%

The Autonomy Tax: Defense Training Breaks LLM Agents

自主性税:防御训练破坏LLM智能体

Shawn Li, Yue Zhao

机构 * University of Southern California(南加州大学)

专题命中 工具调用 :agent(abstract);分类 cs.AI、cs.LG

AI总结 揭示防御训练在提升LLM智能体安全性时,系统性地破坏其工具执行能力,导致任务失败率飙升,且无法有效防御复杂攻击。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.24024 2026-08-31 cs.AI 版本更新 57%

Beyond Confidence: Test-Time Scaling for Multi-Turn Search Agents via Retrieval Grounding

超越置信度:基于检索 grounding 的多轮搜索智能体测试时缩放

Hyunho Kook, Junhyuk So, Tianyu Fu, Haizhong Zheng, Beidi Chen

机构 * University of Southern California(南加州大学) Pohang University of Science and Technology (POSTECH)(浦项科技大学) Tsinghua University(清华大学) Carnegie Mellon University(卡内基梅隆大学)

专题命中 工具调用 :agent(abstract);分类 cs.AI

AI总结 针对多轮搜索智能体中基于置信度投票因复制膨胀失效的问题,提出检索接地投票(RGV)方法,在四个基准和五个 LLM 上性能优于基线,准确率最高提升 5.4%

Comments Accepted to EMNLP 2026 Findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.02009 2026-08-31 cs.AI 版本更新 57%

HALT: Verification-Aware Stopping for Retrieval-Augmented Search Agents

HALT:面向检索增强搜索智能体的感知验证式停止策略

Daeyoung Roh, Donghee Han

机构 * KAIST(韩国科学技术院)

专题命中 工具调用 :agent(abstract);分类 cs.AI

AI总结 该研究针对检索增强搜索智能体的冗余检索问题,提出轻量级感知验证停止策略HALT,在三个多跳QA基准上减少冗余搜索且保持精确匹配,无需修改宿主智能体。

Comments Accepted to Findings of EMNLP 2026. 23 pages, 6 figures. Code: this https URL (https://github.com/Noverse0/HALT)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.28001 2026-08-31 cs.HC cs.MA 新提交 50%

FocusGen: Expanding Visual Design Exploration with a Simulated Focus Group of Persona Agents

FocusGen:通过模拟角色智能体的虚拟焦点小组拓展视觉设计探索

Jaewon Choi, Helena Vasconcelos, Hyun Lee, Carolyn Zou, Tak Yeon Lee, Michael Bernstein

专题命中 工具调用 :agent(abstract)

AI总结 FocusGen是引入虚拟角色智能体焦点小组的交互式视觉设计系统,可拓展设计探索、提升输出多样性,助力设计师突破思维定式,同时存在刻板印象风险,为早期构思提供发散支架。

Comments 18 pages, 7 figures, 6 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.27631 2026-08-31 cs.IR 新提交 50%

Beyond the Vacuum: Combinatorial Strategy Selection for Competitor-Aware Generative Engine Optimization

超越真空:面向感知竞争对手的生成式引擎优化的组合策略选择

Vaibhav Sourirajan, Yao Zhang, Himanshu Kumar, Sahil Wadhwa, Mann Patel, Amirfarrokh Iranitalab

专题命中 工具调用 :agentic(abstract)

AI总结 本研究将生成式引擎优化(GEO)形式化为感知竞争对手的策略选择问题,提出两阶段流程,在相关基准及合成数据集上实现最优性能且可跨域迁移。

Comments 20 pages, 2 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.28239 2026-08-31 cond-mat.mtrl-sci 新提交 50%

QUBO-Compatible Active Learning for Inverse Design of High-Entropy Alloys

适用于二次无约束二元优化(QUBO)的高熵合金逆向设计主动学习方法

Giorgio Silvi, Kirsten Bark, Rolando Reiner, Nicolas Vogt, Thomas Plehn, Daniel Barragan-Yani, Marc Landmann, David Melching

专题命中 工具调用 :workflow(abstract)

AI总结 该研究提出适用于QUBO的高熵合金逆向设计主动学习框架,结合预训练图神经网络、二元变分自编码器与二次因式分解机,经基准测试可实现高效QUBO兼容的材料逆向设计。

详情

展开后加载摘要…

URL PDF HTML 收藏