arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

AI Agent

智能体、工具调用、规划、工作流、多智能体和自主任务执行。

2026-09-01 至 2026-09-01 共收录 46 信号源:cs.AI, cs.CL, cs.LG, cs.SE

1. 工具调用 46 篇

2602.00994 2026-09-01 cs.AI 版本更新 90%

Reasoning and Tool-use Compete in Agentic RL:From Quantifying Interference to Disentangled Tuning

推理与工具使用在智能体强化学习中的竞争:从量化干扰到解耦调优

Yu Li, Mingyang Yi, Xiuyu Li, Ju Fan, Fuxin Jiang, Binbin Chen, Peng Li, Jie Song, Tieying Zhang

机构 * School of Information, Renmin University of China(中国人民大学信息学院) Bytedance Inc.(字节跳动公司)

专题命中 工具调用 :tool-use(title,abstract);agentic(title,abstract);agent(abstract);tool use(abstract)

AI总结 本文通过引入能力效应归因(CEA)量化推理与工具使用行为之间的干扰,并提出解耦动作-推理调优(DART)框架,通过分离参数更新来提升智能体强化学习的性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.02475 2026-09-01 cs.AI 版本更新 89%

AgentRx: Diagnosing AI Agent Failures from Execution Trajectories

AgentRx: 从执行轨迹诊断AI代理故障

Shraddha Barke, Arnav Goyal, Alind Khare, Avaljot Singh, Suman Nath, Chetan Bansal

机构 * Microsoft Research(微软研究院) Microsoft(微软)

专题命中 工具调用 :agent(title,abstract);AI agent(title,abstract);multi-agent(abstract);分类 cs.AI

AI总结 AgentRx通过自动化诊断框架,从执行轨迹中定位AI代理的关键故障步骤,并提升跨领域的故障归因能力。

Comments Accepted to EMNLP Findings 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.20994 2026-09-01 cs.CR cs.AI cs.CL 版本更新 88%

Breaking MCP with Function Hijacking Attacks: Novel Threats for Function Calling and Agentic Models

打破MCP:函数劫持攻击:函数调用和代理模型的新威胁

Yannis Belkhiter, Giulio Zizzo, Sergio Maffeis, Seshu Tirupathi, John D. Kelleher

机构 * IBM Research Europe(IBM欧洲研究院) Trinity College Dublin(三一学院都柏林) Imperial College London(帝国理工学院伦敦) ADAPT Research Centre(ADAPT研究中心)

专题命中 工具调用 :function calling(title,abstract);agentic(title,abstract);分类 cs.AI、cs.CL

AI总结 本文提出了一种新的函数劫持攻击,通过操纵代理模型的工具选择过程,迫使调用特定攻击者选择的函数,展示了代理模型在函数调用接口上的新漏洞。

Comments Accepted to TMLR (08/26)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.29397 2026-09-01 cs.CL 新提交 87%

AlgoWorlds: Benchmarking Tool Use for Global Optimization in Algorithmic Worlds

AlgoWorlds:用于算法世界中全局优化的工具使用基准

Zixiang Xu, Jiaan Wang, Fandong Meng

机构 * Weixin AI, Tencent(腾讯微信AI) University of Southern California(南加州大学)

专题命中 工具调用 :tool use(title);agent(abstract);tool-use(abstract);planning(abstract)

AI总结 本研究推出AlgoWorlds基准,评估大语言模型在算法世界中利用工具将信息转化为全局最优决策的能力,实验显示领先模型仅38.61%案例能达精确最优。

Comments Homepage: this https URL (https://xzx34.github.io/AlgoWorlds/) Code: this https URL (https://github.com/xzx34/AlgoWorlds)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.30685 2026-09-01 cs.AI 新提交 85%

ATLAS: Dual-Horizon Diagnostic Evaluation for Industrial Tool-Use Agents

ATLAS:面向工业工具使用智能体的双视角诊断评估框架

Wei Chen, Peilun Zhou, Zhaoyu Hu, Jiajun Chai, Zhongni Hou, Yufei Zhang, Derong Xu, Guojun Yin, Wei Lin, Zhi Zheng, Tong Xu

机构 * University of Science and Technology of China(中国科学技术大学) Meituan(美团)

专题命中 工具调用 :tool-use(title,abstract);agent(abstract);tool use(abstract);分类 cs.AI

AI总结 本文针对工业工具使用LLM智能体的评估缺陷,提出双视角诊断评估框架ATLAS,经美团小团生产流量验证,可提升服务质量并优化策略。

Comments 25 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.27995 2026-09-01 cs.AI 版本更新 85%

AsyncTool: Evaluating the Asynchronous Function Calling Capability under Multi-Task Scenarios

AsyncTool: 多任务场景下异步函数调用能力的评估

Kou Shi, Ziao Zhang, Shiting Huang, Avery Nie, Zhen Fang, Qiuchen Wang, Lin Chen, Huaian Chen, Zehui Chen, Feng Zhao

机构 * University of Science and Technology of China(中国科学技术大学) University of Toronto(多伦多大学)

专题命中 工具调用 :function calling(title);agent(abstract);tool use(abstract);tool-use(abstract)

AI总结 提出AsyncTool基准,通过模拟工具响应延迟的多任务环境,评估基于大语言模型的智能体在异步工具调用中的任务协调与效率。

Comments this https URL (https://github.com/StoKou/repo-asynctool)

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.12449 2026-09-01 cs.CR cs.AI 版本更新 85%

AgenTRIM: Tool Risk Mitigation for Agentic AI

AgenTRIM:代理AI的工具风险缓解

Roy Betser, Amit Giloni, Shamik Bose, Sindhu Padakandla, Chiara Picardi, Lidor Erez, Roman Vainshtein

机构 * Fujitsu Research of Europe (FRE)(富士通欧洲研究(FRE)) Fujitsu Research of India Pvt. Ltd. (FRIPL)(富士通印度私人有限公司(FRIPL))

专题命中 工具调用 :agentic(title);agent(abstract);AI agent(abstract);tool use(abstract)

AI总结 AgenTRIM通过离线和在线阶段检测并缓解代理AI中工具驱动的风险,减少攻击成功率同时保持任务性能。

Comments EMNLP 2026 Findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.19197 2026-09-01 cs.CL cs.AI 版本更新 85%

SPADE: Self-Play in Adaptive Synthetic Executable Environments

SPADE:自适应合成可执行环境中的自博弈

Bo Liu, Simon Yu, Yiding Jiang, Ao Qu, Andrew Zhao, Zichen Liu, Junsu Kim, Zijian Zhou, Seungone Kim, Tongzheng Ren, Mickel Liu, Hanfei Yu, Zhaorun Chen, Weiyan Shi, Paul Pu Liang, Luke Zettlemoyer, Yejin Choi, Natasha Jaques

机构 * University of Washington(华盛顿大学) Stanford University(斯坦福大学) Northeastern University(东北大学) Carnegie Mellon University(卡内基梅隆大学) Massachusetts Institute of Technology(麻省理工学院) National University of Singapore(新加坡国立大学) Seoul National University(首尔大学) Stevens Institute of Technology(史蒂文斯理工学院) University of Chicago(芝加哥大学)

专题命中 工具调用 :agent(abstract,abstract_cn);tool use(abstract);tool-use(abstract);agentic(abstract)

AI总结 SPADE是一种双角色自博弈强化学习框架,让单个LLM同时担任环境设计者与推理智能体,在多类基准上显著提升了语言智能体的性能,推动了开放式自我改进。

Comments Work in progress. Project page: this https URL (https://spade-rl.github.io); Code: this https URL (https://github.com/spade-rl/spade)

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.10283 2026-09-01 cs.MA 版本更新 83%

Modeling User-System Behavior for Training-free Building of Private Domain Conversational Agents

为无监督构建私有领域对话智能体建模用户-系统行为

Won Ik Cho, Woonghee Han, Kyung Seo Ki, Young Min Kim

专题命中 工具调用 :agent(abstract);tool use(abstract);tool-use(abstract);agentic(abstract)

AI总结 该研究提出一种无需数据生成与模型微调的私有领域工具调用多智能体系统构建框架,通过工具使用文档建模用户与系统行为,可实现对私有工具的可扩展适配,支持企业级对话系统的轻量级部署。

Comments 11 pages, 1 figure, 2 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.29063 2026-09-01 cs.AI 新提交 83%

Agent2UCB: Agentic System for Generative Engine Optimization

Agent2UCB:用于生成式引擎优化的智能系统

Sheldon Yu, Rui Wang, Tong Yu, Sungchul Kim, Doga Dogan, Junda Wu, Julian McAuley

机构 * UC San Diego(加州大学圣地亚哥分校) Adobe Research(奥多比研究院)

专题命中 工具调用 :agentic(title,abstract);workflow(abstract);分类 cs.AI

AI总结 该研究提出智能GEO系统Agent2UCB,通过评估9种策略并结合多臂老虎机策略优化内容,在GEO-Bench实验中实现可见性提升且保留SEO质量,还提供SEO评估与演示功能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.29309 2026-09-01 cond-mat.mtrl-sci cs.AI physics.app-ph 新提交 83%

Evaluating LLM-based AI agents integrated with materials synthesis tools: the case of atomic layer deposition

评估集成了材料合成工具的基于大语言模型(LLM)的智能体:以原子层沉积为例

Angel Yanguas-Gil

专题命中 工具调用 :AI agent(title,abstract);tool-use(abstract);分类 cs.AI

AI总结 本研究以原子层沉积为案例,提出了评估集成材料合成工具的基于LLM的AI智能体的实用框架,涵盖多类基准并可推广至其他材料合成技术。

Comments Invited prospective paper submitted to MRS Communications

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.30952 2026-09-01 cs.LG cs.CL 新提交 81%

One Policy Is Enough: Single-Agent Reinforcement Learning Outperforms Tree Search for Chemistry Tool Learning

一个策略就足够:单智能体强化学习在化学工具学习中优于树搜索

Armin Dariani, Sifan Wu, Bang Liu, Entao Yang

机构 * DIRO, Université de Montréal(蒙特利尔大学DIRO学院) Mila - Quebec Artificial Intelligence Institute(米拉-魁北克人工智能研究所) Air Liquide(液化空气集团)

专题命中 工具调用 :agent(title);tool use(abstract);分类 cs.CL、cs.LG

AI总结 该研究提出单智能体强化学习模型,在ChemToolBench多工具化学任务上,相较CheMatAgent的树搜索方法,在Qwen-2.5-7B和Llama-3.1-8B上提升了工具F1、返回F1及答案通过率,且成本更低。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.29096 2026-09-01 cs.LG cs.AI 新提交 81%

Development of an Autonomous AI Coding Agent using Monte Carlo Tree Search (MCTS) and Gemini LLM Frameworks

基于蒙特卡洛树搜索(MCTS)和Gemini大语言模型框架的自主AI编码智能体开发

Pravin Game, Vipin Ramakrishnan, Prathamesh Wagh

专题命中 工具调用 :agent(title,abstract);分类 cs.AI、cs.LG

AI总结 本研究开发了一种结合Gemini LLM与定制MCTS的自主AI编码智能体,通过自评判系统优化代码生成,在复杂逻辑任务上成功率达92%,性能优于零样本生成模型。

Comments 10 PAGES WITH PLAGIARISM REPORT ON 10TH PAGE

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.06854 2026-09-01 cs.LG cs.AI cs.GT 版本更新 81%

A Gold-Standard Study of What Makes a Lightweight Game-Playing Agent Strong

关于使轻量级博弈代理强大的因素的金标准研究

Nima Kelidari, Mohammadsaeed Haghi, Mahdi Salmani

机构 * University of Southern California(美国南加州大学)

专题命中 工具调用 :agent(title,abstract);分类 cs.AI、cs.LG

AI总结 研究不完美信息纸牌游戏中使轻量级博弈代理强大的因素,构建专家代理作标准,经超百次运行确定有效因素,添加基线并应用于另一游戏,得出通用方法可训练有竞争力代理且无需专家训练。

Comments 9 pages, 5 figures, 3 tables. Code and models: this https URL (https://github.com/Nikelroid/adversarial-coevolution)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.30091 2026-09-01 cs.AI 新提交 79%

VERA: Authority-Preserving Edge Revocation for Federated AI-Agent Workflows

VERA:联邦AI智能体工作流中保留权限的边撤销机制

Lifei Liu, Haoran Yu, Xiaochong Jiang

专题命中 工具调用 :agent(title,abstract);分类 cs.AI

AI总结 针对联邦AI智能体工作流的权限一致性问题,提出VERA可验证边撤销机制,解决树级联过度撤销与部署者级联欠撤销问题,在LangGraph等框架中验证了其有效性与模式可移植性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.26037 2026-09-01 cs.CL 版本更新 79%

Peak-Then-Collapse and the Four Interface Channels of Knowledge-Graph Tool Use

先升后降与知识图谱工具使用的四个接口通道

Tianda Sun, Dimitar Kazakov

机构 * University of York(约克大学)

专题命中 工具调用 :tool use(title);tool-use(abstract);分类 cs.CL

AI总结 本文通过最小化知识图谱工具API实验,发现标准RLVR工具使用配方在自验证检索奖励下出现先升后降的崩溃模式,并识别出四种接口失败模式,提出接口反馈差异是核心原因,单次自蒸馏可缓解但受接口限制。

Comments 17 pages, 9 figures. Accepted at EMNLP 2026; revised following peer review

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.18364 2026-09-01 cs.AI cs.GR cs.MA 版本更新 79%

Training and Agentic Inference Strategies for LLM-based Manim Animation Generation

基于LLM的Manim动画生成的训练与代理推理策略

Ravidu Suien Rammuni Silva, Ahmad Lotfi, Isibor Kennedy Ihianle, Golnaz Shahtahmassebi, Jordan J. Bird

机构 * Department of Computer Science, Nottingham Trent University, Nottingham, United Kingdom(计算机科学系,诺丁汉特伦特大学,诺丁汉,英国)

专题命中 工具调用 :agentic(title,abstract);分类 cs.AI

AI总结 本文提出ManimTrainer和ManimAgent,结合监督微调与强化学习,提升文本到代码到视频的转换性能,通过ManimBench评估17种模型,结果显示GRPO和RITL-DOC策略显著提升动画生成质量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.30702 2026-09-01 cs.CL cs.AI cs.LG 新提交 78%

An Agentic Retrobiosynthesis Framework with Learned Frontier Selection

一种基于学习的前沿选择的智能体逆生物合成框架

Philippe Meyer, Guillaume Gricourt, Thomas Duigou, Joan Hérisson, Jean-Loup Faulon

机构 * Université Paris-Saclay(巴黎萨克雷大学) INRAE(法国国家农业食品与环境研究院) AgroParisTech(巴黎高科农业学院)

专题命中 工具调用 :agentic(title);分类 cs.AI、cs.CL、cs.LG

AI总结 该研究提出基于学习前沿选择的智能体逆生物合成框架,经微调的Qwen2.5-7B策略在多个基准上优于MCTS等方法,可提升预算内逆合成搜索性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.30268 2026-09-01 cs.AR 新提交 78%

FABO: Agent-Guided Discovery of Joint Breakpoint Optimization for Timing-Driven Routing Trees

FABO:智能体引导的时序驱动布线树联合断点优化发现

Shang Liu, Wenji Fang, Jing Wang, Hongxin Kong, Yao Lu, Zhiyao Xie

专题命中 工具调用 :agent(title,abstract)

AI总结 针对布线树优化问题,本研究开发智能体框架发现SALT的结构局限,提出FABO算法,在129万个ICCAD15网络上实现导线长度降低,FABO-FAST可高效优化多数网络。

Comments 13 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.28695 2026-09-01 cs.CV cs.IR 新提交 78%

Weaving Visual Narratives: Agentic Image Bundle Composition Beyond Atomic Visual Matching

编织视觉叙事:超越原子视觉匹配的智能体图像束合成

Rong Shan, Tianyi Xu, Congmin Zheng, Wenteng Chen, Jiachen Zhu, Junjie Wu, Teng Wang, Weiwen Liu, Changwang Zhang, Weinan Zhang, Jun Wang, Jianghao Lin

机构 * Shanghai Jiao Tong University(上海交通大学) Shanghai Innovation Institute(上海创新研究院) OPPO(OPPO(广东欧珀移动通信有限公司))

专题命中 工具调用 :agentic(title,abstract)

AI总结 针对传统图像检索原子匹配范式无法捕捉用户视觉搜索意图的问题,提出BundleWeaver智能体框架,构建IBCBench数据集,实现图像束合成并取得显著性能提升。

Comments Accepted by EMNLP'26 Main Conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.07146 2026-09-01 cs.CV 版本更新 78%

Learning to Search: A Decision-Based Agent for Knowledge-Based Visual Question Answering

学习搜索:一种基于决策的知识增强视觉问答代理

Zhuohong Chen, Zhenxian Wu, Yunyao Yu, Hangrui Xu, Zirui Liao, Zhifang Liu, Xiangwen Deng, Pen Jiao, Haoqian Wang

机构 * Tsinghua University(清华大学) University of Arizona(亚利桑那大学) Hefei University of Technology(合肥工业大学)

专题命中 工具调用 :agent(title,abstract)

AI总结 本文提出基于决策的KB-VQA代理,通过多步骤决策过程解决视觉问答问题,改进检索与推理整合,提升对稀有实体和长尾事实的处理能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.29357 2026-09-01 cs.AI 新提交 77%

LiteSearch-VL: Small Multimodal Search Agents via Trajectory Distillation and Synthetic Step-DPO

LiteSearch-VL:通过轨迹蒸馏和合成步级DPO实现的小型多模态搜索智能体

Saeed Khaki, Nima Safaei, Kamal Ginotra

机构 * Microsoft AI(微软人工智能) Ohio State University(俄亥俄州立大学)

专题命中 工具调用 :agent(abstract);tool use(abstract);agentic(abstract);分类 cs.AI

AI总结 该研究提出LiteSearch-VL方案,通过轨迹蒸馏和合成步级DPO,在单节点预算下将多模态搜索智能体能力迁移至Qwen3-VL-2B等小型模型,使其在多模态视觉问答任务上取得接近4B模型的性能,明确小型多模态智能体的下一瓶颈是答案验证而非搜索深度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.29942 2026-09-01 cs.CR cs.AI 新提交 74%

Influence Is Not Authority: When Causal Guardrail Signals Make Legitimate Tool Use Look Like an Attack in Tool-Using LLM Agents

影响并非权威:在使用工具的大语言模型智能体中,因果护栏信号为何会让合法工具使用看起来像攻击

Tanzim Ahad, Ismail Hossain, Md Jahangir Alam, Sai Puppala, Syed Bahauddin Alam, Sajedul Talukder

专题命中 工具调用 :tool use(title);分类 cs.AI

AI总结 该研究指出基于影响的大语言模型智能体护栏无法可靠区分合法与恶意工具操作,经多组实验验证了该局限,并测试了语义监控器、影子护栏等方案的表现,为安全决策提供了参考。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.29224 2026-09-01 cs.CL cs.AI cs.CR 版本更新 73%

Relevance as a Vulnerability: How Web Retrieval Degrades Safety Alignment in LLM Agents

相关性即漏洞:网络检索如何削弱LLM智能体的安全对齐

Aditya Nawal, Manit Baser, Mohan Gurusamy

机构 * Department of Electrical and Computer Engineering(电子与计算机工程系) National University of Singapore(新加坡国立大学)

专题命中 工具调用 :agent(abstract);AI agent(abstract);分类 cs.AI、cs.CL

AI总结 本文提出AgentREVEAL框架,分析检索集成方式和内容属性如何导致LLM智能体安全退化,发现相关性是共同激活条件,并引入HarmURLBench基准。

Comments Accepted to EMNLP 2026 Findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.30147 2026-09-01 cs.CL 新提交 70%

CAST: Critique-Aware Supervision for Training Reliable Long-Horizon Tool-Calling Agents

CAST:用于训练可靠长程工具调用智能体的批判感知监督

Amir Saeidi, Zehua Zhang, Rishitosh Singh, Naman Ahuja, Vivek Gupta, Ali Payani, Gaowen Liu, Jayanth Srinivasa, Chitta Baral

机构 * Arizona State University(亚利桑那州立大学) Cisco Research(思科研究院)

专题命中 工具调用 :agent(abstract);agentic(abstract);分类 cs.CL

AI总结 提出批判感知训练框架CAST,通过分析智能体轨迹生成结构化批判,优化Qwen3模型,在零售、远程医疗等动态工具调用任务上提升可靠性,性能优于GPT-OSS-120B。

Comments Accepted to EMNLP 2026 (Main)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.28062 2026-09-01 cs.AI 版本更新 70%

WeAgent-MMSearch: Native Text-Vision Interaction for Multimodal Search Agents

WeAgent-MMSearch:面向多模态搜索智能体的原生文本-视觉交互

Zongkai Liu, Hui Zhang, Liqiang Niu, Zhen Cao, Han Li, Juntao Liu, Wenchao Chen, Chengduo Zhao, Chao Yu, Fandong Meng

机构 * Weixin AI, Tencent(腾讯微信人工智能) Sun Yat-sen University(中山大学)

专题命中 工具调用 :planning(abstract);agentic(abstract);分类 cs.AI

AI总结 针对现有多模态搜索智能体忽略图像、长程交互易失败的问题,提出 WeAgent-MMSearch 系统,通过 WeAgent-Harness 实现文本-视觉交互,经 FA-GSPO 后训练后,模型在多模态搜索基准上性能大幅提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.03163 2026-09-01 cs.MA cs.AI cs.DC 版本更新 70%

OpenAgenet / OAN Yellow Paper: Technical Architecture for Trust-Governed Resource Identity and Discovery

OpenAgenet/OAN:信任治理的智能体身份与发现技术架构

Jinliang Xu

机构 * OpenAgenet / OAN

专题命中 工具调用 :agent(abstract);workflow(abstract);分类 cs.AI

AI总结 本文提出OpenAgenet/OAN协议中立信任层技术架构,通过角色架构、身份对象、注册工作流、根治理生命周期、根验证包模型、授权感知发现、签名可信调用、验证要求、状态转换、安全属性、实现边界和部署考虑,实现异构智能体框架(包括MCP、A2A、ANP类系统及领域特定协议)的身份准入、可发现、可验证和安全交互。

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.14323 2026-09-01 cs.CL 版本更新 70%

Beyond Semantic Similarity: Reducing Unnecessary API Calls via Behavior-Aligned Retriever

超越语义相似度:通过行为对齐检索减少不必要的API调用

Yixin Chen, Ying Xiong, Shangyu Wu, Yufei Cui, Xue Liu, Nan Guan, Chun Jason Xue

机构 * City University of Hong Kong(香港城市大学) Mohamed Bin Zayed University of Artificial Intelligence(马尔代夫穆罕默德·本·扎耶德人工智能大学) McGill University(麦吉尔大学)

专题命中 工具调用 :tool use(abstract);tool-use(abstract);分类 cs.CL

AI总结 该研究针对工具增强型LLM的不必要API调用问题,提出行为对齐检索(BAR)方法,通过训练感知行为的相似度排序演示示例,在多类骨干网络和基准中提升调用可靠性、减少API调用。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.29128 2026-09-01 cs.AI cs.LG cs.SE 新提交 67%

APIFlow-Bench: Measuring Whether Agents Survive Long, Dependent API Workflows

APIFlow-Bench:评估智能体能否完成长时程、存在依赖关系的API工作流

Zelin Wan, Arash Nourian, Xiaoxiao Li, Nihar Nandan, Kamalakannan Nandagopal

机构 * Postman, Inc.(波斯特曼公司)

专题命中 工具调用 :workflow(abstract);分类 cs.AI、cs.LG、cs.SE

AI总结 该研究推出APIFlow-Bench基准,评估智能体完成长时程依赖API工作流的能力,实验发现依赖链长度、模型可靠性影响成功率,复合故障不符合独立误差假设。

Comments 15 pages, 8 figures. Under review at the NeurIPS 2026 Workshop on Evaluation of Interactive Agents (IAEval). Harness, frozen task bank, and 44,362 execution transcripts: this https URL (https://github.com/postmanlabs/APIFlow-Bench)

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.26872 2026-09-01 cs.LG cs.AI cs.CL 版本更新 67%

When the Strongest Teacher Is Not the Best Teacher: Student-Centric Answer Selection

最强的教师并不总是最好的教师:以学生为中心的答案选择

Zhengyu Hu, Zheyuan Xiao, Linxin Song, Fengqing Jiang, Yuetai Li, Zhihan Xiong, Yue Liu, Junhao Lin, Yao Su, Lijie Hu, Kaize Ding, Teng Xiao, Radha Poovendran

机构 * University of Washington(华盛顿大学) University of Texas at Austin(德克萨斯大学奥斯汀分校) University of Southern California(南加州大学) Independent Researcher(独立研究者) National University of Singapore(新加坡国立大学) Microsoft(微软) Google(谷歌) Mohamed bin Zayed University of Artificial Intelligence(穆罕默德·本·扎耶德人工智能大学) Northwestern University(西北大学) Allen Institute for AI (AI2)(人工智能研究院(AI2))

专题命中 工具调用 :tool-use(abstract);分类 cs.AI、cs.CL、cs.LG

AI总结 提出以学生为中心的答案采样(SCAS)框架,通过估计学生中心的学习成本选择教师生成的答案,从而提升学生模型性能。

详情

展开后加载摘要…

URL PDF HTML 收藏