When the API Speaks the Wrong Language: Revisiting Post-Training for Multilingual Tool Use
当API“说错”语言:重新审视多语言工具使用的后训练
机构 * Amazon(亚马逊)
专题命中 工具调用 :tool use(title);分类 cs.AI、cs.CL
AI总结 针对多语言API调用中存在的参数语言不匹配问题,研究发现监督微调可实现接近或优于复杂强化学习方法的性能,强化学习仅能提供渐进式改进。
AI 大模型
智能体、工具调用、规划、工作流、多智能体和自主任务执行。
当API“说错”语言:重新审视多语言工具使用的后训练
机构 * Amazon(亚马逊)
专题命中 工具调用 :tool use(title);分类 cs.AI、cs.CL
AI总结 针对多语言API调用中存在的参数语言不匹配问题,研究发现监督微调可实现接近或优于复杂强化学习方法的性能,强化学习仅能提供渐进式改进。
形式化监视器为何失效:攻击分布熵作为基于LTL的LLM智能体安全的覆盖边界
机构 * Ryonix Labs Inc.(Ryonix实验室公司)
专题命中 工具调用 :agent(title);分类 cs.AI、cs.LG
AI总结 该研究揭示基于LTL的LLM智能体安全监视器覆盖差异源于攻击分布熵,提出熵-覆盖边界并验证,引入部署前熵测试,可预测监视器覆盖并支持架构感知选择。
Comments 6 pages, 1 figure. Accepted at the 13th IEEE International Conference on Intelligent Systems (IS'26), Varna, Bulgaria, 2026
SAGA:用于智能文本到SPARQL生成的模式感知基础
专题命中 工具调用 :agentic(title);分类 cs.AI、cs.LG
AI总结 研究复杂知识库问答中语义解析范式,针对现有智能体类型盲基础问题,提出无训练框架SAGA,通过模式约束基础操作,维护类型状态,过滤候选属性,以紧凑格式呈现图模式,在多基准设置上取得优异成绩。
TraceGrant:一种用于联网LLM智能体任务-效应生命周期的合约治理安全框架
专题命中 工具调用 :agent(abstract,abstract_cn);tool use(abstract)
AI总结 TraceGrant是通过显式合约治理联网LLM智能体任务-效应生命周期的安全框架,在两类基准攻击案例中未出现攻击成功,且能关联用户意图、执行与任务完成。
结果监控器:针对静默工具故障的恢复可行性
专题命中 工具调用 :agent(abstract,abstract_cn);分类 cs.AI、cs.CL、cs.SE
AI总结 该研究针对智能体决策中的静默工具故障问题,提出结果监控器方法,可检测结果契约违反并提供恢复工具,显著提升ToolMaze和tau-bench任务的完成率。
Comments 16 pages (9 main + 7 pages supplementary material), 3 figures
FedAgentKE:异构智能体的联邦语义知识演化
专题命中 工具调用 :agent(abstract);tool use(abstract);workflow(abstract)
AI总结 研究异构智能体孤立运行问题,提出 FedAgentKE 框架,通过语义知识蒸馏、聚合和Adapt实现联邦语义知识演化,实验验证其在跨框架和跨任务设置下能改进智能体协作,为未来协作智能体生态系统发展提供潜力。
Comments 9 pages (including appendix)
给定增量的埃塔:用边际工具效用定义大语言模型工具效率
机构 * Foam(泡沫)
专题命中 工具调用 :agent(abstract);tool use(abstract);分类 cs.AI、cs.CL、cs.SE
AI总结 研究提出用于评估LLM智能体轨迹中工具调用率的工具效率及边际工具效用指标,用LLM-as-a-Judge确定边际工具效用符号,区别于间接测效率的 prior work,直接测效率,为LLM评估研究及相关工程做贡献。
SkillFuzz: 面向开放技能市场中隐式意图发现的技能组合模糊测试
机构 * School of Computer Science and Informatics, University of Liverpool(利物浦大学计算机科学与信息学学院) ; Mohamed bin Zayed University of Artificial Intelligence(穆罕默德·本·扎耶德人工智能大学)
专题命中 工具调用 :agent(abstract);planning(abstract);分类 cs.AI、cs.CL、cs.SE
AI总结 提出SkillFuzz,首个无需执行的模糊测试方法,通过提取结构化技能契约并利用契约引导的蒙特卡洛树搜索,在开放技能市场中高效发现因技能组合导致的隐式意图,验证了80%以上高风险组合。
Comments Under Review
Object Aligner: 一种可配置的图结构JSON模式相似度评分,应用于LLM提示优化
机构 * Artificial Intelligence Center, Faculty of Electrical Engineering, Czech Technical University in Prague(捷克理工大学电气工程学院人工智能中心)
专题命中 工具调用 :planning(abstract);agentic(abstract);分类 cs.AI、cs.CL、cs.LG
AI总结 提出Object Aligner,一种基于递归树对齐和引用对齐的JSON相似度评分方法,通过Weisfeiler-Leman颜色细化近似图同构,用于LLM输出评估和提示优化。
Comments 28 pages, This is a submitted version of a manuscript under review at IEEE Access; it has not been peer reviewed
SGHA:基于证据的研究问题发现,使用本地语言模型
机构 * C-MInDS, IIT Bombay(印度理工学院孟买分校C-MInDS) ; Machine Learning Department, MBZUAI(穆罕默德·本·扎耶德人工智能大学机器学习系)
专题命中 工具调用 :agent(abstract,abstract_cn);分类 cs.AI、cs.LG
AI总结 该研究提出SGHA,一种基于本地9B开源LLM的研究问题发现系统,通过构建文献证据图检测研究差距,经对比实验证明其可实现可核查的研究问题构建,无需依赖专有前沿模型。
Comments Link to Code and artifacts: https://github.com/SarveshVGharat/structural-gap-hypothesis-agent
ToolMinimize:审计与重写大语言模型智能体的工具调用以最小化隐私暴露
专题命中 工具调用 :agent(title);分类 cs.SE
AI总结 ToolMinimize是一款中间件,通过拦截并重写LLM智能体的工具调用参数,结合schema感知分析与四种操作,在保证100%任务有效性的同时大幅降低隐私暴露,可选层可进一步提升效果,延迟极低。
用于证据导向学术深度搜索的结构受限智能体图探索方法
机构 * National University of Singapore(新加坡国立大学) ; TCG CREST ; Indian Institute of Technology Kharagpur(印度理工学院卡拉格普尔分校) ; Singapore Institute of Technology(新加坡理工学院) ; Indian Institute of Technology Bombay(印度理工学院孟买分校)
专题命中 工具调用 :agentic(title);分类 cs.CL
AI总结 Crase是一种有界可检查的学术搜索方法,通过1.5跳引用邻域扩展等操作,在50万篇arXiv论文的基准上,召回率@50最高达同类深度研究智能体的3倍且成本仅为其三分之一。
AHEAD:用于智能体强化学习的环境增强蒸馏自适应回溯
机构 * AWS AI Labs(亚马逊云科技人工智能实验室) ; Purdue University(普渡大学)
专题命中 工具调用 :agentic(title);分类 cs.AI
AI总结 AHEAD是一种步骤感知的智能体强化学习框架,通过匹配不同监督源适配步骤类型,在多任务及多模型规模下提升了GRPO算法的任务成功率,减少了训练步骤并适配更严格的交互预算。
Comments 22 pages, 15 figures, 7 tables
智能体基准测试的噪声底审计
专题命中 工具调用 :agent(title);分类 cs.CL
AI总结 该研究针对BFCL基准的工具调用端点,审计了重复运行与提示扰动带来的测量变异性,发现提示扰动是更大噪声来源,边际准确率掩盖了稳定性与失败模式。
Comments 10 pages, 1 figure, 6 tables
AgonAlpha:通过提示经济与可扩展智能体搜索实现自主阿尔法发现
机构 * The Chinese University of Hong Kong(香港中文大学) ; University of Maryland(马里兰大学)
专题命中 工具调用 :agentic(title);分类 cs.AI
AI总结 AgonAlpha是首个结合经验证构件搜索、对抗审核器与并行预算分配的阿尔法挖掘系统,在WorldQuant BRAIN部署后产出SPECTACULAR级阿尔法,为交易因子自主研究提供了完整证据轨迹。
VectraYX-Vision-1B:一款具备结构化视觉推理与原生工具使用能力的20亿参数以下西班牙语/拉丁美洲网络安全多模态模型
机构 * Globant(高博特科技)
专题命中 工具调用 :tool use(title);分类 cs.CL
AI总结 本研究推出VectraYX-Vision-1B,一款20亿参数以下西班牙语/拉丁美洲网络安全多模态模型,支持结构化推理与工具调用,针对网络UI优化,同时报告了其视觉定位的负面结果及相关修复方案,开源了模型与数据。
Comments 11 pages, 1 figure
CEDAR:面向复杂系统目标导向优化的智能体编排树搜索算法
机构 * Sakana AI
专题命中 工具调用 :agent(title);分类 cs.AI
AI总结 针对复杂系统目标导向设计的难题,提出基于LLM智能体的CEDAR方法,通过LLM驱动的MCTS实现复杂系统的目标导向发现,减少人力投入并促进其跨领域应用。
Comments Accepted as Talk in ALIFE 2026: The 2026 Conference on Artificial Life
BiCAA:面向搜索增强智能体的双向信用分配
专题命中 工具调用 :agent(title);分类 cs.CL
AI总结 针对搜索增强智能体多步搜索任务中普通GRPO的稀疏监督问题,提出BiCAA双向信用分配框架,融合前向可解性增益与后见成功关键性构建密集过程奖励,实现稳定策略优化并取得有竞争力的QA性能。
智能体神经架构搜索
机构 * Artificial Intelligence Graduate School, Ulsan National Institute of Science and Engineering(人工智能研究生院,乌山科学与工程研究院) ; Department of Computer Science and Engineering, Ulsan National Institute of Science and Engineering(计算机科学与工程系,乌山科学与工程研究院)
专题命中 工具调用 :agentic(title);分类 cs.AI
AI总结 研究探索LLM驱动设计与NAS驱动搜索的分工,提出用LLM生成种子架构并分解为带插槽架构供NAS搜索的机制,在AgentNAS中实例化,在多任务上表现出色,两种搜索机制互补。
工具使用何时会增强有限精度循环模型的表达能力?
机构 * Robotics and Perception Group University of Zurich(机器人感知组苏黎世大学) ; Shenzhen International Center for Industrial and Applied Mathematics(深圳国际工业与应用数学中心) ; Shenzhen Research Institute of Big Data(深圳大数据研究 institute) ; Tengen Intelligence Institute CRRC Zhuzhou Institute(腾云智能研究院 CRRC 长沙研究所)
专题命中 工具调用 :tool use(title);分类 cs.CL
AI总结 研究工具使用对有限精度循环模型表达能力的影响,通过将模型建模为与预言机交互的有限状态控制器,得出有限状态工具基本不增加表达能力,单个无限状态磁带使系统图灵完备,且特定单层控制器可实现此构造的结论。
Comments 24 pages
超越下一个词预测:Atlassian工作流中工具使用代理的RLVR概念验证
机构 * Centific
专题命中 工具调用 :tool-use(title);分类 cs.AI
AI总结 针对企业SaaS工作流中LLM因目标不匹配导致的静默失败,提出在目标环境中直接应用可验证奖励强化学习(RLVR),在五个合成Jira/Confluence环境中训练Qwen模型,将平均奖励从0.35-0.92提升至0.95-1.00。
流式工具使用何时有帮助?表征流式检索增强生成中的工具意图稳定化
机构 * SMG Labs(SMG实验室)
专题命中 工具调用 :tool use(title);分类 cs.CL
AI总结 通过测量工具意图稳定化(即推测查询收敛到答案的时间点),在CRAG基准上分析流式RAG的延迟隐藏效果,发现73.9%的查询可实现显著延迟隐藏,并识别早期与晚期稳定化的预测因素。
通过训练期间回收零方差查询实现智能体搜索的有效强化学习
机构 * Language Technologies Institute, Carnegie Mellon University(卡内基梅隆大学语言技术研究所) ; Instituto Superior Técnico and INESC-ID, University of Lisbon(里斯本大学理工学院和INESC-ID) ; NOVA LINCS, NOVA School of Science and Technology(NOVA科学与技术学院LINCS)
专题命中 工具调用 :agentic(title);分类 cs.AI
AI总结 提出查询回收方法,将训练中零方差查询重新投入采样池,使有效训练分布随策略演化,1.7B模型在7个多跳QA基准上平均Pass@1达66.0,匹配或超越7B模型。
朴素提示优化:重新思考复杂提示搜索的必要性
机构 * Purdue University(普渡大学)
专题命中 工具调用 :autonomous agent(abstract);agentic(abstract);分类 cs.AI、cs.CL
AI总结 该研究提出轻量级朴素提示优化(NPO),发现其性能优于复杂优化器GEPA,且优化后的提示可迁移至同系列其他模型,表明简单线性提示优化可媲美复杂搜索方法。
Comments 22 pages, 12 figures
SpeechGym:一种用于通过强化学习训练语音智能体的原生音频 Gym
机构 * University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) ; Amazon AGI Foundations(亚马逊AGI基础研究部)
专题命中 工具调用 :agent(abstract);agentic(abstract);分类 cs.AI、cs.CL
AI总结 研究针对语音智能体训练中梯度无法流动、难以强化学习的问题,提出原生音频环境 SpeechGym,用每轮过程奖励解决稀疏性问题,使开放权重模型在语音基准上任务成功率翻倍且排名提升。
PeakBench:面向大语言模型智能体的资源感知工具调用基准测试
机构 * School of Artificial Intelligence, Nanjing University(南京大学人工智能学院) ; Nanjing University(南京大学)
专题命中 工具调用 :agent(abstract);planning(abstract);分类 cs.AI、cs.SE
AI总结 PeakBench是面向LLM智能体的资源感知工具调用基准,通过两部分评估框架解耦逻辑规划与物理调度,实验表明资源信息可减少溢出、提升利用率,为相关研究提供测试平台。
ToolRobustBench:工具调用智能体的分阶段扰动评估与故障诊断
专题命中 工具调用 :agent(abstract);tool-use(abstract);分类 cs.AI、cs.SE
AI总结 本研究推出ToolRobustBench,这一工具调用智能体的分阶段诊断基准,通过四类扰动族评估7个模型等的15456个实例,发现工具输出/观测扰动是主要瓶颈,可诊断工具调用故障来源与传播。
Enrich-Retrieve-Rank:将能力发现扩展至上下文路由之外
机构 * Amazon AGI(亚马逊AGI)
专题命中 工具调用 :agent(abstract);multi-agent(abstract);分类 cs.AI、cs.CL
AI总结 该研究提出Enrich-Retrieve-Rank流程,将能力发现从上下文路由扩展,经实验验证其在大规模MATS组件场景下,比Full-Ctx、Search&Pick基线性能更优且成本更低,已作为多智能体平台的默认能力发现层投入生产。
Comments 11 pages, 4 figures, and 12 tables
恢复自动研究智能体中浪费的计算资源
机构 * Columbia University(哥伦比亚大学) ; Georgetown University(乔治城大学) ; Capital One(第一资本金融公司)
专题命中 工具调用 :agent(abstract);agentic(abstract);分类 cs.AI、cs.LG
AI总结 本文针对自动研究智能体应用于表格数据集时的四类计算资源浪费问题,提出针对性干预措施,仅通过优化智能体设计即可大幅提升其性能。
DOCSCHISEL:面向大语言模型智能体的自适应工具文档优化框架
专题命中 工具调用 :agent(abstract);tool-use(abstract);分类 cs.AI、cs.LG
AI总结 该研究针对LLM智能体工具文档的异质性与泛化问题,提出DocsChisel自适应优化框架,经实验较原始文档及EasyTool、DRAFT基线大幅提升任务成功率,且开销有限。