Small Language Models for Agentic Systems: A Survey of Architectures, Capabilities, and Deployment Trade offs
专题命中 工具调用 :agentic(title,abstract);agent(abstract);tool use(abstract);planning(abstract)
Comments 9 Pages
AI 大模型
智能体、工具调用、规划、工作流、多智能体和自主任务执行。
专题命中 工具调用 :agentic(title,abstract);agent(abstract);tool use(abstract);planning(abstract)
Comments 9 Pages
AppWorld-UL:用于工具使用的多样化智能体-用户交互基准测试
专题命中 工具调用 :agent(title,abstract);tool-use(title,abstract);分类 cs.AI、cs.CL、cs.LG
AI总结 研究针对当前智能体-用户交互基准测试不足,引入 AppWorld-UL 基准测试,基于 AppWorld 框架及模拟应用构建多样任务,用大型语言模型模拟用户行为,评估显示其难度大,能推动回路中工具使用智能体研究。
Comments ICML 2026
代理间金融:面向自主AI代理的区块链支付与信任基础设施
专题命中 工具调用 :agent(title,abstract);AI agent(title,abstract);autonomous agent(abstract)
AI总结 本文提出代理间金融概念,利用区块链可编程结算、智能钱包、去中心化注册表和可验证计算解决自主AI代理在身份、授权、支付、验证、声誉和问责方面的协调摩擦,强调有限自主权设计。
Comments 22 pages, 3 figures, 4 tables
ParaVT: 平衡工具先验悖论以实现代理视频强化学习中的并行工具使用
机构 * MiroMind ; NTU(国立台湾大学) ; HKU(香港大学) ; HKUST(GZ)(香港科技大学(广州)) ; THU(清华大学) ; LMMs-Lab(LMMs实验室)
专题命中 工具调用 :agentic(title,abstract);tool use(title);agent(abstract);multi-agent(abstract)
AI总结 本文提出ParaVT,一种用于并行视频工具调用的端到端强化学习框架,通过引入PARA-GRPO机制解决工具先验悖论,提升了长视频理解的性能。
Comments Project Page: https://evolvinglmms-lab.github.io/ParaVT/
AI代理社区的崛起:Moltbook上 discourse 和 interaction 的大规模分析
专题命中 工具调用 :agent(title,abstract);AI agent(title,abstract);agentic(abstract)
AI总结 研究分析了Moltbook上AI代理的讨论主题、发布行为及互动模式,揭示了代理自我意识的形成机制及社区协调的特征。
专题命中 工具调用 :agent(title,abstract);multi-agent(title,abstract);planning(abstract)
Comments Accepted for the 2025 IEEE International Conference on Robotics and Automation (ICRA), May 19-23, 2025, Atlanta, USA
专题命中 工具调用 :agent(title,abstract);multi-agent(title,abstract);planning(abstract)
专题命中 工具调用 :agent(title,abstract);multi-agent(title,abstract);planning(abstract)
Comments Published at the 15th IEEE International Symposium on Safety, Security, and Rescue Robotics 2017 (SSRR 2017) in Shanghai, China
从智能体痕迹到信任:LLM智能体中的证据追踪与执行溯源
机构 * Griffith University(格里菲斯大学) ; Jiangsu University(江苏大学) ; University of Southern Queensland(南方昆士兰大学) ; Peking University(北京大学) ; Great Bay University(大湾大学) ; Nanjing University(南京大学) ; Macquarie University(麦觉瑞大学) ; Southern University of Science and Technology(南方科学与技术大学)
专题命中 工具调用 :agent(title,abstract);tool use(abstract);tool-use(abstract);planning(abstract)
AI总结 本文系统综述了LLM智能体中的证据追踪与执行溯源方法,通过统一溯源视角连接检索、工具使用、记忆等环节,提出分类体系并讨论开放挑战。
Token Budgets: 63个LLM-Agent预算超支事件的实证目录,以及一个仿射类型化Rust缓解案例研究
专题命中 工具调用 :agent(title,title_cn);multi-agent(abstract);分类 cs.SE
AI总结 通过分析21个编排框架中的63个生产事故,提出一个八类故障分类法,并构建一个基于仿射类型的Rust库(token-budgets)来在编译时防止预算超支,实验证明其不可绕过性。
Comments 26 pages. Artifact (catalog CSV, Rust crate, formal proofs): https://github.com/sajjadanwar0/token-budgets
Rollout Cards: 代理研究的可重复性标准
机构 * Deepflow ; Nanyang Technological University(南洋理工大学)
专题命中 工具调用 :agent(title,abstract);tool use(abstract);tool-use(abstract);agentic(abstract)
AI总结 本文提出Rollout Cards作为代理研究的可重复性标准,通过保留rollout记录并声明报告规则,解决评估结果不可复现的问题。
EpochX:构建一个涌现代理文明的基础设施
机构 * QuantaAlpha
专题命中 工具调用 :agent(title,abstract);AI agent(abstract);tool use(abstract);workflow(abstract)
AI总结 EpochX通过引入信用原生市场基础设施,重构代理AI为组织设计问题,实现可验证工作留下的持久可重用资产,支持可持续的人机协作。
人类欢迎观察:Agent社会网络Moltbook的首次观察
机构 * CISPA Helmholtz Center for Information Security(CISPA海德堡信息安全研究中心)
专题命中 工具调用 :agent(title,abstract);AI agent(abstract);autonomous agent(abstract);tool use(abstract)
AI总结 本文研究了首个专为AI代理设计的社会网络Moltbook,分析其主题讨论、风险分布及毒性演变,揭示了代理社交网络中信息传播的复杂性及平台稳定性挑战。
Comments 16 pages
ToolBrain: 一种灵活的强化学习框架用于智能工具
机构 * ToolBrain Research(ToolBrain研究机构) ; University College Cork(大学学院科克) ; CeADAR University College Dublin(CeADAR大学学院都柏林) ; IBM Research Lab(IBM研究实验室)
专题命中 工具调用 :agentic(title,abstract);agent(abstract);tool use(abstract);tool-use(abstract)
AI总结 ToolBrain通过灵活的强化学习框架提升智能代理的工具使用能力,支持多种训练策略并提供高效微调和推理功能。
AgentSwift: 通过价值引导的分层搜索高效设计LLM代理
专题命中 工具调用 :agent(title,abstract);tool use(abstract);planning(abstract);workflow(abstract)
AI总结 AgentSwift通过价值引导的分层搜索高效设计LLM代理,实现8.34%的性能提升。
Comments AAAI-2026
专题命中 工具调用 :AI agent(title,abstract);agent(abstract);tool use(abstract);workflow(abstract)
ToolAnchor:锚定反事实上下文以提升智能体工具使用能力
机构 * Fudan University(复旦大学) ; Nanyang Technological University(南洋理工大学) ; MIT(麻省理工学院)
专题命中 工具调用 :agentic(title,abstract);tool-use(title);agent(abstract);分类 cs.AI、cs.LG
AI总结 研究针对工具增强大语言模型智能体在工具集扩展时的问题,提出ToolAnchor框架,通过在关键决策点注入反事实锚定上下文打破行为惯性,经教师模型假设、学生展开验证及智能体后训练,提升其在扩展工具集下的性能,为智能体强化学习开辟新路径。
“我不知道”过滤器:提高函数调用中智能体的可靠性
机构 * University of California, Davis, Department of Computer Science(加州大学戴维斯分校计算机科学系) ; Okareo, Inc.(Okareo公司) ; University of California, Davis, Department of Mathematics(加州大学戴维斯分校数学系)
专题命中 工具调用 :function calling(title,abstract);agentic(title);agent(abstract);分类 cs.AI、cs.SE
AI总结 研究语言模型在函数调用基准测试中性能提升但因训练评估指标致幻觉问题。提出考虑错误函数调用负面结果的评估指标及可量化不确定性、去除有害函数调用的轻量级可训练过滤器,助力智能体知道何时说“我不知道”以提升可靠性。
知识驱动工具使用工作流中AI代理的声明式技能
机构 * School of Computing and Information Systems(计算与信息系统学院) ; Singapore Management University(新加坡管理大学)
专题命中 工具调用 :AI agent(title,abstract);tool-use(title);agent(abstract);分类 cs.AI、cs.SE
AI总结 提出声明式代理(通过自然语言技能文件控制流程)在知识密集型客服工作流中优于命令式状态机和无脚手架基线,但检索质量是主要瓶颈。
超级智能检索代理:代理检索的下一个前沿
机构 * Meta Superintelligence Labs(Meta超级智能实验室) ; Rice University(里士满大学)
专题命中 工具调用 :agent(title,abstract);agentic(title,abstract);分类 cs.AI、cs.LG
AI总结 提出SIRA,通过单次语料判别性检索压缩多轮探索,利用LLM丰富文档词汇、预测查询缺失词汇并基于语料统计过滤,在BEIR基准上取得最强平均检索性能,并在下游QA任务中超越RL训练的代理系统。
自反式API:结构优于冗长,助力AI代理恢复
机构 * Siemens Digital Industries Software, USA(西门子数字工业软件公司)
专题命中 工具调用 :agent(title,abstract);AI agent(title,abstract);分类 cs.AI、cs.SE
AI总结 提出自反式API,在验证失败时返回机器可读的结构化建议,使AI代理无需外部推理即可修复请求并重试,在Anthropic模型上将任务完成率提升36.7-40.0个百分点,且每成功令牌效率提升1.8-2.2倍。
ToolScope: 通过工具合并和上下文感知过滤增强LLM代理的工具使用
机构 * Oracle AI
专题命中 工具调用 :tool use(title,abstract);agent(title);tool-use(abstract);分类 cs.CL、cs.SE
AI总结 ToolScope通过自动校正的工具合并和上下文感知检索提升LLM代理的工具选择准确性,实验表明在三个顶级LLM和开源基准上提升了8.38%至38.6%的准确率。
Comments ACL Main Conference 2026
打破MCP:函数劫持攻击:函数调用和代理模型的新威胁
机构 * IBM Research Europe(IBM欧洲研究院) ; Trinity College Dublin(三一学院都柏林) ; Imperial College London(帝国理工学院伦敦) ; ADAPT Research Centre(ADAPT研究中心)
专题命中 工具调用 :function calling(title,abstract);agentic(title,abstract);分类 cs.AI、cs.CL
AI总结 本文提出了一种新的函数劫持攻击,通过操纵代理模型的工具选择过程,迫使调用特定攻击者选择的函数,展示了代理模型在函数调用接口上的新漏洞。
DIVE:在代理任务合成中扩展多样性以实现通用工具使用
专题命中 工具调用 :agentic(title,abstract);tool use(title);tool-use(abstract);分类 cs.AI、cs.SE
AI总结 DIVE通过反转合成顺序,先执行多样化的现实工具并反向推导任务,从而提升代理任务合成的多样性,使模型在不同任务和工具集下的泛化能力显著增强。
专题命中 工具调用 :agent(title,abstract);multi-agent(title,abstract);分类 cs.AI、cs.CL
Comments 9 pages, 3 figures. Code and data available at https://github.com/alvco/Founding_Fathers_AI
机构 * ∗ , Keisuke Okumura 1,2∗ , Michael Amir 1 , Amanda Prorok 1(1、Okumura、Amir、Prorok)
专题命中 工具调用 :agent(title,abstract);multi-agent(title,abstract);分类 cs.AI、cs.LG
机构 * University of Waterloo(滑铁卢大学) ; Sea AI Lab(Sea AI 实验室) ; University of Toronto(多伦多大学) ; Shanghai University(上海大学) ; HKUST(香港科技大学) ; M-A-P ; National University of Singapore(新加坡国立大学)
专题命中 工具调用 :tool use(title,abstract);agentic(title,abstract);分类 cs.AI、cs.CL
Comments 32 pages, 5 figures, 13 tables
机构 * SenseTime Research(商汤科技研究院)
专题命中 工具调用 :tool use(title,abstract);agentic(title,abstract);分类 cs.AI、cs.CL
专题命中 工具调用 :agent(title,abstract);agentic(title,abstract);分类 cs.AI、cs.CL
Comments Project Homepage: https://osu-nlp-group.github.io/Mind2Web-2/
专题命中 工具调用 :agentic(title,abstract);tool use(title);function calling(abstract);分类 cs.AI、cs.CL