Creative Robot Tool Use with Large Language Models
专题命中 工具调用 :tool use(title,abstract);planning(abstract);分类 cs.AI、cs.LG
Comments 19 pages, 14 figures, 2 tables
AI 大模型
智能体、工具调用、规划、工作流、多智能体和自主任务执行。
专题命中 工具调用 :tool use(title,abstract);planning(abstract);分类 cs.AI、cs.LG
Comments 19 pages, 14 figures, 2 tables
机构 * Peking University(北京大学) ; University of California, Santa Barbara(加州大学圣巴巴拉分校) ; University of Arizona(亚利桑那大学)
专题命中 工具调用 :agent(title,abstract);agentic(abstract);分类 cs.AI
Comments ACL 2025 main. The code can be found at https://github.com/Arvid-pku/Godel_Agent
STAC:当无害工具形成危险链以劫持LLM代理
机构 * AWS AI Labs(AWS人工智能实验室) ; UC Berkeley(伯克利大学)
专题命中 工具调用 :agent(abstract);autonomous agent(abstract);tool use(abstract);tool-use(abstract)
AI总结 STAC通过多轮工具链攻击揭示LLM代理的安全漏洞,提出基于推理的防御策略,显著降低攻击成功率。
Comments Long version with 15 pages in main draft and a total of 39 pages including references and appendix. Data and code \url{https://github.com/amazon-science/MultiTurnAgentAttack}
MCPZoo:大规模可运行模型上下文协议服务器数据集用于AI代理
专题命中 工具调用 :agent(title);AI agent(title)
AI总结 MCPZoo是一个大规模可运行模型上下文协议服务器数据集,用于支持AI代理与外部工具交互的实证研究和安全分析
专题命中 工具调用 :agent(title);multi-agent(title)
专题命中 工具调用 :agent(abstract);tool use(abstract);workflow(abstract);multi-agent(abstract)
专题命中 工具调用 :agent(title);multi-agent(title)
专题命中 工具调用 :agent(title);multi-agent(title)
AgentJudgeBench:用于评估智能体工具调用的多难度基准
机构 * ServiceNow AI(ServiceNow人工智能部门)
专题命中 工具调用 :agentic(title,abstract);workflow(abstract);分类 cs.AI
AI总结 该研究提出AgentJudgeBench基准,评估LLM评判在智能体工具调用工作流上的可靠性,发现其对齐度随难度下降,真实值并非总有益,还给出了实用评估指南。
Comments 31 Pages, 9 Figures, 31 Tables, Accepted as a main conference paper at EMNLP 2026
SPT:将技能作为智能体语言模型的预训练数据
机构 * Beijing University of Posts and Telecommunications(北京邮电大学) ; Tsinghua University(清华大学)
专题命中 工具调用 :agentic(title,abstract);agent(abstract);分类 cs.CL
AI总结 本研究提出技能预训练(SPT)方法,将公开技能包作为训练数据,结合参考感知组装策略,可提升智能体语言模型的工具使用性能,同时保留通用性能,验证了技能包作为预训练数据源的价值。
多模态智能体真的从工具使用中受益吗?能力增益的系统性研究
专题命中 工具调用 :tool use(title);agent(abstract);tool-use(abstract);分类 cs.AI
AI总结 通过对比工具增强与无工具的多模态智能体在多项任务上的表现,发现工具使用并未带来一致的性能提升,智能体更多是学会了工具调用模式而非真正利用工具扩展能力。
AdaVDR:面向视频深度研究的自适应工具使用与反思
机构 * Alibaba Group(阿里巴巴集团) ; Beijing Institute of Technology(北京理工大学)
专题命中 工具调用 :tool use(title);agent(abstract);tool-use(abstract);分类 cs.AI
AI总结 提出AdaVDR自适应视频深度研究智能体,通过自适应工具调用与反思解决视频深度研究的不当工具调用等问题,构建相关基准并在VDR-EE、VideoDR上取得优于基础模型的效果。
CAS:通过自适应检索与策略加权实现的保形智能体搜索
机构 * Zhejiang University(浙江大学) ; ZJU-UIUC Institute, Zhejiang University(浙江大学ZJU-UIUC学院) ; Tencent Inc.(腾讯公司)
专题命中 工具调用 :agentic(title,abstract);agent(abstract);分类 cs.AI
AI总结 本研究针对搜索智能体RL微调的可靠性问题,提出CAS框架,通过自适应检索与策略加权结合CP技术,提升推理准确率并减少冗余搜索,构建高可靠高效智能体范式。
Comments 21 pages, including figures, tables, and appendix
混合强化学习与搜索的飞行轨迹规划
专题命中 工具调用 :planning(title,abstract);agent(abstract);分类 cs.AI
AI总结 本文提出一种混合强化学习与搜索的方法,用于快速优化民航飞行路径,通过预计算近优路径减少求解空间,提升计算效率并保持燃油消耗相近。
上下文压缩会给智能体带来什么代价?任务完成指标未揭示的交互代价
机构 * Chongqing University of Science and Technology(重庆科技学院)
专题命中 工具调用 :agent(title,abstract);planning(abstract);分类 cs.AI
AI总结 该研究针对使用工具的智能体,发现上下文压缩会带来任务完成指标未揭示的隐藏交互成本,检索调用增加是其主要来源,且该特征具有环境依赖性。
基于LLMs菜单的智能体进化,在每个价格点展开竞争
专题命中 工具调用 :agentic(title,abstract);agent(abstract);分类 cs.AI
AI总结 本研究提出进化元智能体RoboPhD,通过对含9个LLM端点的菜单进行智能体进化,在DS-1000和PaperFindingBench两个任务上,除一个位置外占据所有帕累托前沿槽位,实现各价格点的竞争优势。
ACTS-SQL:基于大型语言模型的面向智能体与评判器的树结构化SQL正确性校验
机构 * Renmin University of China(中国人民大学) ; ByteDance Inc.(字节跳动公司)
专题命中 工具调用 :agentic(title,abstract);agent(abstract);分类 cs.AI
AI总结 本文提出无训练框架ACTS-SQL,将SQL修正建模为计划引导的树结构化调试过程,集成执行校验与诊断工具,在BIRD-Critic基准及火山引擎TLS生产环境中均实现显著准确率提升。
ALKEMIE智能体:用于计算材料设计的自主平台
专题命中 工具调用 :agent(title,abstract);agentic(abstract);分类 cs.AI
AI总结 该研究针对材料计算工作流程碎片化的问题,提出集成多种技术的ALKEMIE智能体平台,通过多种材料相关应用验证其能力,并展望了该类平台的未来发展方向与挑战。
当你的智能体打开聊天应用时:智能体控制的原始聊天日志搜索可与结构化记忆相媲美
机构 * University of Science and Technology of China(中国科学技术大学) ; MetaStone Technology(MetaStone科技公司)
专题命中 工具调用 :agent(title,abstract);agentic(abstract);分类 cs.CL
AI总结 该研究提出无语义结构的智能体控制搜索界面ReFind,在MemoryAgentBench等任务上,其检索准确率优于HippoRAG 2等结构化记忆系统,证明可控词汇检索可替代复杂记忆结构实现高效会话记忆任务。
智能体AI:用户赋能还是圈地?
专题命中 工具调用 :agentic(title,abstract);分类 cs.AI
AI总结 本文通过分析广告拦截器等四个领域,指出智能体AI的治理决策本质是政治选择,其配置正被模型上下文协议等专有框架锁定,可能损害用户权益。
Comments Extended version of AIES'2026 publication
红队测试代理型红队
机构 * Cracken ; Information Protection Department, Lviv Polytechnic National University(利沃夫理工学院信息保护系)
专题命中 工具调用 :agentic(title,abstract);agent(abstract);分类 cs.AI
AI总结 本文首次深入分析主流进攻性安全代理系统的安全漏洞,揭示其设计缺陷可导致API密钥泄露、持久化控制及宿主机失陷,并提出架构级缓解设计原则。
Comments v0.1
AI时代的营养数据基础设施:为智能体介导的研究实现FAIR原则
专题命中 工具调用 :agent(title,abstract);AI agent(abstract);分类 cs.AI
AI总结 该研究针对AI智能体介导营养研究的数据歧义问题,提出NDS基础设施,实现FAIR原则,在基准测试中表现优于现有模型,保障分析可复现,为相关研究提供新型数据支撑。
VAKRA:评估工具使用策略下跨API与检索的多跳推理能力
机构 * IBM(国际商业机器公司(IBM))
专题命中 工具调用 :tool-use(title,abstract);agent(abstract);分类 cs.AI
AI总结 本研究推出VAKRA基准评估工具使用策略下跨API与检索的多跳推理,发现现有最优模型在相关任务上性能随推理深度显著下降,失败集中于语言介导推理环节。
基于代理的贝叶斯优化:通过代理增强的自动研究
机构 * Meta ; RWTH Aachen University(亚琛工业大学)
专题命中 工具调用 :agentic(title,abstract);agent(abstract);分类 cs.LG
AI总结 该研究提出代理式贝叶斯优化范式,构建Sara代理与lenz后端,在合成及真实基准测试中,其兼具可靠性与性能,还可动态重构优化问题。
FlowScout:从执行反馈到可靠的工具使用智能体工作流
专题命中 工具调用 :agent(title);workflow(abstract);agentic(abstract);分类 cs.LG
AI总结 FlowScout是从历史任务记录生成工具集成型智能体工作流的执行引导框架,经多任务域评估,其工具调用正确性与执行质量均显著优于PM4Py等基线方法。
智能体阶段一仿星器优化:有限β平衡的自主多目标搜索
专题命中 工具调用 :agentic(title,abstract);agent(abstract);分类 cs.AI
AI总结 本文提出智能体阶段一仿星器优化概念,通过语言模型智能体与DESC执行配合,提升有限β平衡构型的质量与数量,生成结构化决策数据,实现可扩展的多目标优化。
视觉工具使用的错觉:对图像思考的因果审查
机构 * Shanghai Artificial Intelligence Laboratory(上海人工智能实验室) ; Shanghai Jiao Tong University(上海交通大学) ; Shanghai Innovation Institute(上海创新研究院)
专题命中 工具调用 :tool-use(title,abstract);planning(abstract);分类 cs.AI
AI总结 本文通过因果审查方法,发现多模态大语言模型的视觉工具使用存在“调用而不查看”“查看而不规划”等错觉,整体准确率增益下大量场景无因果效果。
CASCADE:一种用于经患者数据验证的下游扰动预测的智能体调控网络框架
专题命中 工具调用 :agentic(title,abstract);agent(abstract);分类 cs.AI
AI总结 该研究提出CASCADE智能体调控网络框架,基于ARACNe网络预测基因扰动下游转录效应,通过TCGA、METABRIC数据验证其MYC基因预测方向的准确性,还评估LLM智能体映射自然语言请求至MCP工具调用的表现,发现其在模糊查询时存在错误选择扰动类型的问题。
对现代LLM代理框架中缺陷的实证研究
专题命中 工具调用 :agent(title,abstract);workflow(abstract);分类 cs.SE
AI总结 本文通过分析998个缺陷报告,发现现代LLM代理框架中缺陷主要源于API误用、不兼容和文档不同步,集中在自我行动阶段,导致功能错误、崩溃和构建失败。
Lean Refactor: 通过代理策略搜索实现多目标可控的证明优化
机构 * Simon Fraser University(西蒙弗雷泽大学) ; Amazon Web Services(亚马逊网络服务) ; MiroMind ; University of Texas at Austin(德克萨斯大学奥斯汀分校)
专题命中 工具调用 :agentic(title,abstract);分类 cs.AI、cs.CL、cs.LG
AI总结 本文提出Lean Refactor框架,通过检索增强的代理策略搜索,解决多目标、可控和版本鲁棒的Lean证明重构问题,主要贡献是通过预注释的多目标重构策略数据库实现高效的证明优化。