arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

AI Agent

智能体、工具调用、规划、工作流、多智能体和自主任务执行。

共收录 518 信号源:cs.AI, cs.CL, cs.LG, cs.SE

1. 工具调用 518 篇

2606.09071 2026-06-09 cs.AI 新提交 79%

REFLECT: Intervention-Supported Error Attribution for Silent Failures in LLM Agent Traces

REFLECT: 针对LLM智能体轨迹中静默失败的干预支持错误归因

Xiaofeng Lin, Yingxu Wang, Tung Sum Thomas Kwok, Daniel Guo, Sahil Arun Nale, Charles Fleming, Guang Cheng

机构 * University of California, Berkeley(加州大学伯克利分校)

专题命中 工具调用 :agent(title);tool-use(abstract);分类 cs.AI

AI总结 提出REFLECT方法,通过诊断候选错误步骤、使用诊断特定补丁进行受控重放测试,并利用验证结果作为对比证据来细化归因,在四个基准上取得最高定位准确率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.08539 2026-06-09 cs.AI 新提交 79%

AgentTrust: A Self-Improving Trust Layer for AI-Agent Actions

AgentTrust: AI代理行为的自改进信任层

Chenglin Yang

机构 * Independent Researcher(独立研究员)

专题命中 工具调用 :agent(title);AI agent(abstract);分类 cs.AI

AI总结 提出AgentTrust v2,通过威胁类型分类(词汇/语义)和自学习机制,在代理行为中实现自改进信任决策,显著提升语义威胁检测准确率并降低误拦。

Comments 29 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.18171 2026-08-20 cs.AI cs.LG 新提交 79%

Looped Language Models Improve Compositional Tool Calling

循环语言模型可提升组合式工具调用能力

Andrei Cristian Popescu, Haitz Sáez de Ocáriz Borde, Pietro Liò

机构 * University of Cambridge(剑桥大学)

专题命中 工具调用 :tool use(abstract);planning(abstract);agentic(abstract);分类 cs.AI、cs.LG

AI总结 该研究在组合式工具调用场景下,通过在多个数据集上对比循环与非循环语言模型,发现循环计算可提升组合式工具使用性能,自适应推理能实现更优计算-性能权衡,为智能体系统提供了有前景的架构。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.16068 2026-08-18 cs.CL cs.AI 新提交 79%

CAPO: Constraint-Aware Prompt Optimization for LLM Agents

CAPO:面向大语言模型智能体的感知约束提示优化

Victor Ye Dong, Reid Pryzant, Yi Liu, Jian Jiao

机构 * Microsoft(微软)

专题命中 工具调用 :agent(abstract);tool use(abstract);agentic(abstract);分类 cs.AI、cs.CL

AI总结 本研究提出CAPO与DCAPO两种方法,通过原始对偶框架优化LLM智能体的系统提示,在智能体及助手式任务中均提升了可行性与性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.13622 2026-08-17 cs.AI cs.CL 新提交 79%

ARC: Fair Relative Advantage Comparison in Open-Ended Real-World Interaction

ARC:开放式真实世界交互中的公平相对优势比较

Yongqi Tong, Tan Li Hui Faith, Choy Zhen Wen Marcus, Zhou Jin, Kewei Fu, Jiang-Ming Yang, Jianshe Li, Xin Zhang

机构 * Ant International(蚂蚁国际)

专题命中 工具调用 :agent(abstract);tool use(abstract);tool-use(abstract);分类 cs.AI、cs.CL

AI总结 针对开放式真实世界交互中基于组的RL轨迹行为不可比导致的奖励公平问题,提出ARC训练方案,结合\textit{inter}范式与\textit{inter-86K}语料库,提升工具使用基准并缩短首次token时间。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.07321 2026-07-09 cs.AI cs.CL cs.MA 新提交 79%

From Atomic Actions to Standard Operating Procedures: Iterative Tool Optimization for Self-Evolving LLM Agents

从原子动作到标准操作程序:自进化语言模型智能体的迭代工具优化

Haipeng Ding, Yuexiang Xie, Zhewei Wei, Yaliang Li, Bolin Ding

机构 * Renmin University of China(中国人民大学) Alibaba Group(阿里巴巴集团)

专题命中 工具调用 :agent(abstract);tool-use(abstract);workflow(abstract);分类 cs.AI、cs.CL

AI总结 研究针对现有LLM智能体框架问题,提出将原子动作合成SOP实现自进化,介绍EvoSOP框架,经实验验证该框架能显著提升任务成功率、减少交互轮数,为自进化智能体开发提供可扩展路径。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.31648 2026-07-01 cs.AI cs.LG 新提交 79%

Think in English, Answer in Korean: Efficient Adaptation of Multilingual Tool-Using Agents

用英语思考,用韩语回答:多语言工具使用智能体的高效适配

Utsav Garg, Sungjin Hong, Jason Jung, Justin Lee, Shaan Desai, Joon Hee Kim, Anirudh Shrinivason, Edmond Wen, Susie Park

机构 * Cohere LG CNS

专题命中 工具调用 :tool-use(abstract);function calling(abstract);agentic(abstract);分类 cs.AI、cs.LG

AI总结 提出LuckyStar 111B混合推理模型,通过多语言监督微调、可验证奖励强化学习、语言一致性奖励和4-bit量化,高效适配多语言工具使用智能体,提升数学推理、函数调用和NL2SQL性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.04788 2026-08-06 cs.LG cs.AI cs.CL 新提交 78%

Agentic Reinforcement Learning with Observation-Calibrated Self-Distillation

带有观测校准自蒸馏的智能体强化学习

Yi Yang, Cong Qin, Xiaodan Liu, Chishui Chen, Qing Dong, Yan Zhang, Cao Liu, Zhao Yang, Lu Pan, Jiaye Lin, Yi Feng

机构 * Meituan(美团)

专题命中 工具调用 :agentic(title);分类 cs.AI、cs.CL、cs.LG

AI总结 本研究针对智能体强化学习的混淆问题,提出OCSD方法,通过对比两类回放视图推导观测残差,在高不确定步骤调制GRPO更新,在三类任务和多模型规模上优于基线。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.03741 2026-08-05 cs.DC 新提交 78%

When Does Disaggregation Pay? Simulating Prefill--Decode--Attention--FFN Specialization for Agentic LLM Inference

拆分何时划算?智能体大语言模型推理的预填-解码-注意力-前馈网络专业化模拟

Przemyslaw Forys, Haoran Wu, Can Xiao, Jiayi Nie, Tony Liu, Rika Antonova, Timothy Jones, Robert Mullins, Wayne Luk, Aaron Zhao, George A. Constantinides

专题命中 工具调用 :agentic(title,abstract)

AI总结 该研究提出HeteroPanacea模拟框架,针对智能体LLM推理的预填-解码-注意力-前馈网络拆分,验证其可提升吞吐量,为异构智能体服务系统提供支撑。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.00847 2026-08-04 cs.CV 新提交 78%

Models as Tools: An Agentic Coordination Framework for Unified Multimodal Visual Tracking

模型作为工具:用于统一多模态视觉跟踪的智能体协调框架

Wenrui Cai, Yuzhe Li, Qingjie Liu, Yunhong Wang

机构 * Beihang University(北京航空航天大学)

专题命中 工具调用 :agentic(title,abstract)

AI总结 针对现有视觉跟踪方法的瓶颈,提出ACTrack智能体协调框架,整合异构模型工具的互补优势,仅用30%可训练参数便在多类基准上实现性能超越。

Comments 21 pages, 15 Tables, 7 Figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.23672 2026-07-28 cs.LO 新提交 78%

Rethinking Logic Optimization Operators: Theory-Derived Operator Compression via Agentic Source Analysis

重新思考逻辑优化运算符:通过智能源分析实现理论驱动的运算符压缩

Keren Zhu

专题命中 工具调用 :agentic(title,abstract)

AI总结 研究逻辑优化运算符,利用智能源分析制定运算符关系实现理论驱动的运算符压缩,形成TACO,实验表明其在减少运行时、节点数和层级等方面表现出色,TACO - max在特定输入行上有较好的NDP几何平均比率。

Comments 23 pages, 4 figures. Code and data: https://github.com/CODA-Team/TACO

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.19801 2026-07-23 cs.IR 新提交 78%

CIR at iKAT SCAI 2026: Exploring Clarification Need Prediction in Agentic Conversational Search

CIR 在 iKAT SCAI 2026 中的研究:探索智能对话搜索中的澄清需求预测

Nolwenn Bernard, Jüri Keller, Philipp Schaer

专题命中 工具调用 :agentic(title,abstract)

AI总结 科隆信息检索小组参与 iKAT SCAI 2026 共享任务,运用配备多种工具的智能对话搜索系统及两种神经澄清需求预测模型进行实验,探索智能对话搜索中的澄清需求预测。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.19339 2026-07-22 cs.CV 新提交 78%

OmniReasoner: Thinking with Long Audio-Video via Native Tool Use

OmniReasoner:通过原生工具使用进行长音频-视频推理

Yu Chen, Caorui Li, Ziyu Xiong, Yidong Wang, Mingqi Gao, Shuman Liu, Biao Liu, Chunfeng Yang, Anxiang Zeng, Haibo Zhang, Chaofan Chen

专题命中 工具调用 :tool use(title);tool-use(abstract)

AI总结 针对长音频-视频推理难题,OmniReasoner提出工具使用后训练框架,通过监督微调与强化学习让全模态语言模型学会调用放大工具,利用TimeAnchor保持时间参数一致性,借助时间增强数据引擎实现可训练,提升了答案准确性与时间定位能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.12412 2026-07-15 econ.TH 新提交 78%

Choice at Finite Capacity: The Bounded Agent as an Information Channel and the Recovery of Walrasian Demand

有限容量下的选择:作为信息通道的有限理性主体与瓦尔拉斯需求的恢复

Avishek Bhandari

专题命中 工具调用 :agent(title,abstract)

AI总结 研究将购物者建模为有限信息通道,其选择是概率分布。核心方法是分析购物者需求对价格变化的反应模式,主要贡献是揭示其反应模式的对称性及需求受预算和压缩影响,而非理性,还涵盖了有限容量策略的人工主体并给出两商品二次型消费者的封闭形式解。

Comments 27 pages, Keywords: bounded rationality, rational inattention, rate distortion, discrete choice, demand theory, Slutsky equation, information theory

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.12575 2026-07-15 cs.CR cs.CY cs.SI 新提交 78%

How Agentic Is Agentic Commerce? A Population-Scale Measurement of x402 Adoption and Authenticity

代理式商业的代理程度如何?x402采用情况与真实性的大规模测量

Shengchen Ling, Yajin Zhou, Lei Wu, Cong Wang

专题命中 工具调用 :agentic(title);AI agent(abstract)

AI总结 研究x402协议在商业中的代理程度,通过链上事件识别结算并确定真正付款人,对Base上的x402进行大规模测量,发现诸多问题,指出结算数量衡量的是可制造性而非采用情况。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.10738 2026-07-14 cs.LG cs.AI cs.CL 新提交 78%

To Answer or to Abstain: Mitigating Search-Agent Hallucinations via Abstention-Aware Reinforcement Learning

回答还是弃权:通过弃权感知强化学习减轻搜索代理幻觉

Fengji Zhang, Tianyu Fan, Yuxiang Zheng, Xinyao Niu, Chengen Huang, Jacky Keung, Bei Chen

专题命中 工具调用 :agent(title);分类 cs.AI、cs.CL、cs.LG

AI总结 研究针对大语言模型训练范式易加剧搜索代理幻觉的问题,提出弃权感知强化学习(AWA-RL),利用模型能力动态塑造弃权奖励,并引入RA-F1指标,实验表明该方法有效提升了搜索代理的性能和可靠性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.07350 2026-07-09 cs.RO 新提交 78%

Towards Reliable Aerial Ground Vehicle Collaboration: An Integrated Planning and Autonomy Framework for Field Deployment

迈向可靠的空地车辆协作:用于实地部署的集成规划与自主框架

Md Safwan Mondal, Luca Russo, James D. Humann, James M. Dotterweich, Pranav Bhounsule

机构 * University of Illinois Chicago(伊利诺伊大学芝加哥分校) DEVCOM Army Research Laboratory(陆军研究实验室)

专题命中 工具调用 :planning(title,abstract)

AI总结 研究针对无人机长时间任务飞行续航受限问题,提出集成规划与自主框架。通过深度强化学习规划器解决协同路由问题,引入标准化API弥合规划与执行差距,还有轻量级重新规划器,经实验验证系统在动态任务中有强大协同导航和适应性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.04259 2026-07-07 cs.RO 新提交 78%

Integrated Graph Search and Model Predictive Control for Smooth and Efficient Path Planning in Autonomous Vehicles

用于自动驾驶车辆平滑高效路径规划的集成图搜索与模型预测控制

Duc-Tien Bui, Ngoc Thinh Nguyen, Hung Duy Nguyen, Dong Bi, Tomislav Mihalj, Arno Eichberger

机构 * Institute of Automotive Engineering, Graz University of Technology(格拉茨工业大学汽车工程研究所) Drone Engineering, University of Applied Science Kufstein Tirol(库夫施泰因蒂罗尔应用科学大学无人机工程系) Automation and Control Institute (ACIN), Vienna University of Technology(维也纳工业大学自动化与控制研究所)

专题命中 工具调用 :planning(title,abstract)

AI总结 提出一种顺序路径规划框架,利用图搜索得到的粗糙路径指导基于模型预测控制的路径细化,在多个超车场景评估算法,相比之前方法能降低横向加速度等,还减少计算成本。

Comments 12th 2026 International Conference on Control, Decision and Information Technologies (CoDIT 2026)

Journal ref 13th 2026 International Conference on Control, Decision and Information Technologies (CoDIT 2026), Bari, Italy, 2026, pp. 1757-1762

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.01469 2026-07-07 cs.CV 新提交 78%

A Cost-Aware, Paired Protocol for Auditing Dynamic Tool Synthesis in Agentic Video Question Answering

一种成本感知的配对协议,用于审计智能视频问答中的动态工具合成

Aseel Mohamed, Rama AlHamidi, Mohamed Rayan Barhdadi, Rasul Khanbayov, Erchin Serpedin, Hasan Kurban

机构 * Texas A&M University(德克萨斯农工大学) Hamad Bin Khalifa University(哈马德·本·哈利法大学)

专题命中 工具调用 :agentic(title,abstract)

AI总结 提出成本感知的配对协议,联合评估准确性与成本,揭示动态工具合成在视频问答中的效率与代价。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.19425 2026-06-19 hep-ph 新提交 78%

LeWRON: Agentic Analysis of Electroweak Phase Transitions

LeWRON:电弱相变的智能体分析

Isaac R. Wang

专题命中 工具调用 :agentic(title,abstract)

AI总结 提出LeWRON框架,通过智能体编排从拉格朗日量到引力波谱的完整电弱相变分析流程,支持复现和探索模式,并开源代码。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.17518 2026-06-17 cs.DC 新提交 78%

SpecGen: Accelerating Agentic Kernel Optimization with Speculative Generation

SpecGen: 利用推测生成加速智能体内核优化

Jihu Guo, Sitian Lu, Tenghui Ma, Wei Gao, Zhisheng Ye, Xingcheng Zhang, Dahua Lin

专题命中 工具调用 :agentic(title,abstract)

AI总结 针对智能体内核优化中生成延迟长、反馈不足和资源利用率低的问题,提出SpecGen系统,通过推测生成在推理过程中提前产生候选内核,并行验证剖析,动态调整资源,并利用远程KV缓存减少前缀重计算,显著降低端到端时间并提升内核加速比。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.10438 2026-06-10 econ.TH 新提交 78%

Sequential Search with Planning

带有规划的序贯搜索

Ruhi Sonal, Saptarshi Mukherjee, Abhinaba Lahiri, Aniruddha Ghosh

专题命中 工具调用 :planning(title,abstract)

AI总结 本文通过有序潘多拉盒子模型研究新产品开发或资源勘探中的序贯搜索,引入规划成本,证明存在与已支付范围相关的保留值,并分析保证效应、已支付范围效应和剩余阶段效应对最优策略的影响。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.06749 2026-06-08 q-bio.QM 新提交 78%

Deterministic access to global viral sequence data enables robust agentic scientific discovery

确定性访问全球病毒序列数据实现稳健的自主科学发现

Ferdous Nasri, Sarah Gurev, Patrick Varilly, Krithik Ramesh, Nuala A. O'Leary, Jonah Cool, Bernhard Y. Renard, Pardis C. Sabeti, Laura Luebbert

专题命中 工具调用 :agentic(title,abstract)

AI总结 针对基于大语言模型的科学代理在病毒数据检索中的高错误率问题,提出确定性查询框架gget virus,通过形式化NCBI Virus过滤流程、元数据约束和结构化记录检索,将检索准确率提升至90%以上,并减少98%数据传输。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.18398 2026-08-20 cs.HC cs.AI 新提交 77%

LEDGER: Claim-to-Evidence Trace Graphs for Auditing LLM Agents

LEDGER:用于审计大语言模型智能体的从主张到证据的追踪图

Daehong Kim, Haichao Miao, Shusen Liu

专题命中 工具调用 :agent(abstract);tool use(abstract);workflow(abstract);分类 cs.AI

AI总结 针对LLM智能体输出审计瓶颈,提出LEDGER系统构建分层追踪图,通过分组节点、添加语义边等实现以证据为中心的审计,揭示工作流决策等关键信息。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.17275 2026-08-19 cs.CR cs.AI 新提交 77%

When Agents Act on Web3: An Attack-Surface Survey of MCP, Skills, and Tool Calling

当智能体在Web3中行动:MCP、技能与工具调用的攻击面调查

Rabimba Karanjai, Yang Lu, Nour Diallo, Wujie Xiong, Lei Xu, Weidong, Shi

专题命中 工具调用 :agent(abstract);AI agent(abstract);tool use(abstract);分类 cs.AI

AI总结 本调查针对智能体通过MCP等在Web3区块链上行动的攻击面,构建风险映射矩阵,发现现有防护不足,推导了相关研究议程。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.08907 2026-08-11 cs.CV cs.AI 新提交 77%

ToolVision: Learning When and How to Use Visual Tools with Capability-Aligned Supervision

ToolVision:通过能力对齐监督学习何时以及如何使用视觉工具

Delin Mao, Chenghao Sun, Jingwei Song, Chishui Chen, Linfeng Zhang

专题命中 工具调用 :agent(abstract);tool use(abstract);multi-agent(abstract);分类 cs.AI

AI总结 针对多模态模型工具使用监督错位问题,提出ToolVision方法,通过能力对齐的SFT与RL监督优化工具使用学习,在多个视觉基准上实现性能提升并将公开发布相关资源。

Comments 18 pages, 13 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.02358 2026-08-04 cs.CL 新提交 77%

ScrambleToolBench: Agents Search Exhaustively Even When Their Own Map Points to the Next Step

ScrambleToolBench:即使自身的“地图”指向下一步,智能体仍会进行穷尽式搜索

Vernon Toh, Navonil Majumder, Zhengyuan Liu, Nancy F. Chen, Soujanya Poria

机构 * Nanyang Technological University(南洋理工大学) Agency for Science, Technology, and Research (A*STAR)(新加坡科学、技术与研究局)

专题命中 工具调用 :agent(abstract);autonomous agent(abstract);tool-use(abstract);分类 cs.CL

AI总结 针对现有工具使用基准依赖先验知识的局限,推出ScrambleToolBench交互式终端基准,评估发现当前语言模型面对环境结构变化时难以实现稳健适应。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.02101 2026-08-04 cs.CL 新提交 77%

Cross-Domain Hybrid OPD for Generalizable Search Agents

面向通用搜索智能体的跨域混合在线策略蒸馏

Hongzhan Chen, Xiaoyu Liu, Dengming Zhang, Minzhou Huang, Dongliang Xu, Jingcheng Xie, Dongxiang Fang, Bowen Qin, Minsheng Hao, Yaozong Shen, Xiaojun Quan, Mona Zhou, Haosheng Zou, Jeff Chen

机构 * Yuanbao Team, Tencent Shanghai Innovation Institute(腾讯上海研究院元宝团队)

专题命中 工具调用 :agent(abstract);planning(abstract);agentic(abstract);分类 cs.CL

AI总结 本研究提出基于混元3架构的元宝搜索智能体训练框架,通过跨域混合在线策略蒸馏联合优化搜索专业化与通用能力,缓解对齐损耗,在现实搜索场景中实现两者的良好平衡。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.29250 2026-08-03 cs.CL 新提交 77%

Data Turnstile: A Scalable Open Framework for Function-Calling Data Generation

Data Turnstile:面向函数调用数据生成的可扩展开源框架

Goutham Ramakrishnan, Megha Sharma

机构 * Amazon AGI(亚马逊AGI)

专题命中 工具调用 :tool-use(abstract);function calling(abstract);agentic(abstract);分类 cs.CL

AI总结 该研究提出开源框架Data Turnstile,可基于用户定义API规范生成高质量函数调用合成训练数据,经其微调的小型语言模型在BFCL、τ²-bench等基准上性能大幅提升,缩小了与更大规模模型的差距。

Comments 16 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.25415 2026-07-29 cs.AI 新提交 77%

A Control System, a Dataset, and a Recipe for Making Frozen LLM Agents Learn a Domain

一种用于使冻结的语言模型智能体学习领域的控制系统、数据集和方法

Debjyoti Paul

机构 * Meta AI

专题命中 工具调用 :tool-use(abstract);planning(abstract);agentic(abstract);分类 cs.AI

AI总结 研究如何让冻结的语言模型智能体学习领域,核心方法是将框架视为特定动作空间,用经典强化学习在线学习策略并以多目标奖励评分,贡献包括用DSPy实例化系统并评估,还发布相关代码、任务套件、训练日志及部署方法。

Comments 8 pages, 1 figure, 3 tables. Code and dataset: https://github.com/dpaul0501/context-optimization-rl

详情

展开后加载摘要…

URL PDF HTML 收藏