Measuring temporal effects of agent knowledge by date-controlled tool use
专题命中 工具调用 :agent(title,abstract);tool use(title);分类 cs.CL
Comments under review, comments welcome
AI 大模型
智能体、工具调用、规划、工作流、多智能体和自主任务执行。
专题命中 工具调用 :agent(title,abstract);tool use(title);分类 cs.CL
Comments under review, comments welcome
专题命中 工具调用 :agent(title,abstract);multi-agent(title);autonomous agent(comments)
Comments In submission to AAMAS 2025 (the 24th International Conference on Autonomous Agents and Multiagent Systems)
超越Top-K:用可解释智能体操作替代黑盒检索
专题命中 工具调用 :agentic(title,abstract);agent(abstract);分类 cs.AI、cs.CL
AI总结 该研究针对长文档检索的结构缺陷,提出无嵌入智能体检索框架READ,在政府财务报告数据集上显著优于密集检索,且性能提升源于操作界面,同时发现BM25与READ无统计差异。
Comments 20 pages, 5 figures, 14 tables. Code, benchmark, and full result trajectories: https://github.com/twospoon/READ
VLD-RAG:用于长的、视觉丰富的多页文档的智能视觉语言检索增强生成
专题命中 工具调用 :agentic(title,abstract);agent(abstract);workflow(abstract);分类 cs.AI、cs.CL
AI总结 研究针对视觉丰富的长文档问答的多模态检索增强生成,提出VLD-RAG框架,构建多模态索引并采用混合检索策略,经智能体工作流程协调,在相关基准上提升了证据页面检索及问答表现,凸显协调验证与混合检索的重要性。
ShopX:面向智能购物中意图到商品实现的基础模型
专题命中 工具调用 :agentic(title,abstract);agent(abstract);planning(abstract);分类 cs.AI、cs.CL
AI总结 提出ShopX基础模型,通过统一意图理解、执行规划和基于语义ID的商品空间操作,解决大语言模型代理在购物中意图到商品实现的瓶颈,在淘宝生产日志任务上优于工具中介系统。
Comments The new version adds additional results and details
MedBeads:面向可信医疗AI的智能体原生不可变数据基底
机构 * Diagnostic Imaging and Interventional Radiology, Institute of Medicine, University of Tsukuba(东京大学医学研究院诊断影像与介入放射学部) ; Center for Cyber Medicine Research, University of Tsukuba(东京大学计算机医学研究中心)
专题命中 工具调用 :agent(title,abstract);AI agent(abstract);workflow(abstract);分类 cs.AI、cs.SE
AI总结 针对医疗AI中电子病历与智能体间的上下文不匹配问题,提出基于Merkle有向无环图的不可变数据架构MedBeads,通过确定性图遍历替代概率检索,实现可审计、防篡改的临床上下文提供。
Comments 23 pages, 5 figures, 3 tables. Reference implementation and reproducible Docker demo available at https://github.com/medbeads/medbeads
开放、可靠且集体:一个由社区驱动的工具使用AI代理框架
机构 * University of Notre Dame(圣母大学) ; Rose-Hulman Institute of Technology(罗斯-霍曼理工学院)
专题命中 工具调用 :AI agent(title);agent(abstract);tool use(abstract);tool-use(abstract)
AI总结 本文提出OpenTools框架,通过标准化工具方案、提供轻量级插件式封装及自动化测试套件,提升工具使用可靠性,实验表明社区贡献的高质量工具在多个架构上提升了6%-22%的任务性能。
为什么多步工具使用强化学习会崩溃以及监督信号如何修复它
机构 * The Key Laboratory of Cognition and Decision Intelligence for Complex Systems, Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所复杂系统认知与决策智能重点实验室) ; School of Artificial Intelligence, University of Chinese Academy of Sciences(中国科学院大学人工智能学院)
专题命中 工具调用 :tool-use(title,abstract);tool use(abstract);agentic(abstract);分类 cs.CL、cs.LG
AI总结 研究发现RL训练LLM工具使用时会出现控制token概率尖峰导致性能崩溃,而交错SFT与RL可提升稳定性,但OOD评估下降。
OpenClaw-Skill:面向智能体大语言模型的集体技能树搜索
机构 * The Hong Kong Polytechnic University(香港理工大学) ; Nanyang Technological University(南洋理工大学) ; Tsinghua University(清华大学) ; Royal Melbourne Institute of Technology(皇家墨尔本理工大学) ; Beijing University of Aeronautics and Astronautics(北京航空航天大学)
专题命中 工具调用 :agentic(title,abstract);tool use(abstract);planning(abstract);分类 cs.AI、cs.CL
AI总结 提出集体技能树搜索(CSTS)框架,通过集体智能生成和评估技能节点,构建结构化、多样且可泛化的技能树,并引入集体技能强化学习,提升大语言模型在工具使用、多步推理和动态环境交互中的智能体能力。
Comments 13 pages, 2 figures
ACC:用于长上下文训练的代理轨迹编译
机构 * MoE Key Lab of BIPC, University of Science and Technology of China(中科院大学科学技术大学MoE关键实验室) ; Shanghai Innovation Institute(上海创新研究院) ; Shanghai AI Laboratory(上海人工智能实验室)
专题命中 工具调用 :agent(title,abstract);tool use(abstract);分类 cs.AI、cs.CL
AI总结 本文提出ACC,一种将代理轨迹编译为长上下文问答对的方法,通过整合多轮交互中的工具响应和环境观察,提升大语言模型的长上下文推理能力。
超越API:探索多模态大语言模型在物理工具使用中的极限
机构 * Singapore Management University(新加坡管理大学) ; The Hong Kong Polytechnic University(香港理工大学)
专题命中 工具调用 :tool use(title,abstract);tool-use(abstract);planning(abstract);分类 cs.AI、cs.CL
AI总结 提出PhysTool-Bench基准,评估多模态大语言模型在真实场景中识别物理工具并规划使用的能力,发现最强模型仅完成21%任务,揭示感知与规划双重缺陷。
AIP: 一种用于学习和治理智能体技能的图表示
机构 * Neo4j USA(Neo4j美国公司) ; Neo4j UK(Neo4j英国公司)
专题命中 工具调用 :agent(title,summary_cn);分类 cs.AI、cs.LG
AI总结 提出Agent指令协议(AIP),将有向执行图作为技能表示,通过编译人类编写的技能提升任务表现,并支持技能的可诊断修复与治理。
基于熵引导的工具感知优化用于高效智能体强化学习
机构 * National Key Laboratory for Novel Software Technology, Nanjing University(南京大学新型软件技术国家重点实验室) ; Nanyang Technological University(南洋理工大学) ; China Mobile NineVerse Artificial Intelligence Technology (Beijing) Co., Ltd.(中国移动九章人工智能技术(北京)有限公司) ; Institute of Artificial Intelligence, NineVerse(九章人工智能研究院)
专题命中 工具调用 :agentic(title,abstract);tool use(abstract);tool-use(abstract);分类 cs.AI、cs.LG
AI总结 提出TAO-RL框架,通过工具感知轨迹过滤和熵引导探索解决智能体强化学习中工具使用导致的训练不稳定问题,在7个推理基准上优于现有方法。
EnvFactory: 通过可执行环境合成和鲁棒强化学习扩展工具使用智能体
机构 * LARK, HKUST (GZ)(LARK,香港科技大学(广州)) ; University of Cambridge(剑桥大学) ; UCL(伦敦大学学院) ; Huawei Technologies Co., Ltd(华为技术有限公司)
专题命中 工具调用 :tool-use(title,abstract);agentic(abstract,abstract_cn);分类 cs.CL、cs.LG
AI总结 本文提出EnvFactory框架,通过自动合成可执行环境和鲁棒强化学习,解决工具使用智能体扩展中的环境可扩展性和训练数据不足问题,显著提升训练效率和下游性能。
Comments 11 pages
AgentStop: 早期终止本地AI代理以在消费设备中节省能源
机构 * University of Massachusetts Amherst(马萨诸塞大学阿默斯特分校) ; Brave Software, Imperial College London(Brave软件公司,伦敦帝国学院)
专题命中 工具调用 :AI agent(title);autonomous agent(abstract);tool use(abstract);agentic(abstract)
AI总结 研究提出AgentStop方法,通过预测并提前终止可能失败的代理任务,减少能源消耗,提升本地AI代理的能效与隐私保护。
Comments ACM CAIS '26
重新思考Pi-Serini中的代理搜索:词汇检索是否足够?
机构 * University of Waterloo(滑铁卢大学) ; Stencilzeit University of Waterloo(斯泰尔齐特大学)
专题命中 工具调用 :agentic(title,abstract);agent(abstract);tool-use(abstract);分类 cs.AI、cs.CL
AI总结 本文探讨了在代理循环中,随着LLM能力提升,词汇检索是否足够。通过结合BM25与前沿LLM,引入Pi-Serini搜索代理,展示其在BrowseComp-Plus上优于现有检索代理的性能。
Comments 15 pages, 4 figures
无编码且隐私保护的代理框架用于数据驱动的临床研究
机构 * Infmedix, Co., Ltd.(Infmedix公司) ; Department of Transdisciplinary Studies, Seoul National University(首尔国立大学跨学科研究系) ; Healthcare AI Research Institute, Seoul National University Hospital(首尔国立大学医院医疗人工智能研究所) ; Department of Medicine, Seoul National University College of Medicine(首尔国立大学医学院医学系) ; Department of Transdisciplinary Medicine, Seoul National University Hospital(首尔国立大学医院跨学科医学系) ; Department of Radiology, Massachusetts General Hospital and Harvard Medical School(麻省总医院放射科及哈佛医学院)
专题命中 工具调用 :agentic(title,abstract);planning(abstract);workflow(abstract);分类 cs.AI、cs.CL
AI总结 本文提出CARIS框架,通过整合大语言模型与模块化工具,实现无需编程的自然语言驱动研究,提升临床研究效率与隐私保护。
Comments 10 pages, 5 figures, 2 tables, Supplementary Appendix
形式而非功能:Moltbook网络中的代理社交行为
机构 * University of Passau(帕绍大学) ; IT:U Austria(奥地利IT:U)
专题命中 工具调用 :agent(title,abstract);AI agent(abstract);multi-agent(abstract);分类 cs.AI、cs.CL
AI总结 研究分析Moltbook社交网络中代理的互动、内容和指令层行为,发现其社交层未能有效形成,而技术层则对变化作出反应,导致社交形式存在但功能缺失。
大语言模型代理中工具使用的演变:从单工具调用到多工具编排
机构 * Harbin Institute of Technology(哈尔滨工业大学) ; Harvard University(哈佛大学) ; Huawei Technologies Co., Ltd.(华为技术有限公司)
专题命中 工具调用 :tool use(title,abstract);agent(abstract);planning(abstract);分类 cs.CL、cs.SE
AI总结 本文探讨了大语言模型代理中工具使用从单次调用到长期编排的演变,分析了多工具代理的最新进展,涵盖任务规划、安全控制、效率优化及实际应用等领域。
CCTU:一种复杂约束下的工具使用基准
机构 * College of Computer Science and Artificial Intelligence(计算机科学与人工智能学院)
专题命中 工具调用 :tool use(title,abstract);tool-use(abstract);function calling(abstract);分类 cs.AI、cs.CL
AI总结 本文提出CCTU基准,用于评估大语言模型在复杂约束下的工具使用能力,通过200个精心设计的测试案例,揭示模型在约束遵循和自我完善方面的不足。
TURA:面向人工智能搜索的工具增强统一检索代理
专题命中 工具调用 :agent(title,abstract);tool-use(abstract);agentic(abstract);分类 cs.AI、cs.CL
AI总结 TURA通过结合RAG与代理工具使用,首次系统性地弥合静态RAG与动态信息源之间的差距,提升人工智能搜索的实时性和准确性。
DeepRead: 一种基于文档结构的推理以增强代理搜索
机构 * State Key Laboratory of AI Safety, Institute of Computing Technology, Chinese Academy of Sciences (CAS)(人工智能安全国家重点实验室,计算技术研究所,中国科学院) ; University of Chinese Academy of Sciences, CAS(中国科学院大学) ; Wenlan School of Business, Zhongnan University of Economics(中南财经政法大学文澜商学院)
专题命中 工具调用 :agentic(title,abstract);agent(abstract);tool-use(abstract);分类 cs.AI、cs.CL
AI总结 DeepRead通过结构感知的文档推理增强代理搜索,有效提升文档理解精度。
Comments This version has significantly enhanced the clarity of our research
野生环境中代理的频谱护栏:通过注意力拓扑检测工具使用幻觉
机构 * Devoteam
专题命中 工具调用 :tool use(title,abstract);agent(abstract);autonomous agent(abstract);分类 cs.AI、cs.LG
AI总结 通过分析注意力拓扑谱,提出一种无需训练数据的防护方法,有效检测代理幻觉,揭示模型错误时注意力噪声特征。
Comments 32 pages, 2 fgures, 18 tables
行动背后的缘由:通过代理归因揭示内部驱动因素
机构 * Shanghai Artificial Intelligence Laboratory(上海人工智能实验室) ; Renmin University of China(中国人民大学) ; National University of Singapore(新加坡国立大学)
专题命中 工具调用 :agentic(title,abstract);agent(abstract);tool use(abstract);分类 cs.AI、cs.CL
AI总结 本文提出通用代理归因框架,通过分层方法识别代理行为的内部驱动因素,提升代理系统的安全性和可问责性。
代理能力问题:通过信息论界限预测可解性
机构 * Blavatnik School of Computer Science(布拉瓦特尼克计算机科学学院) ; Tel Aviv University(特拉维夫大学)
专题命中 工具调用 :agent(title,abstract);autonomous agent(abstract);agentic(abstract);分类 cs.AI、cs.LG
AI总结 本文提出代理能力问题框架,通过信息论界限预测代理解决任务的资源需求,结合主动学习、贝叶斯优化和强化学习原理,提升搜索效率。
机构 * BAAI(北京人工智能研究院)
专题命中 工具调用 :agent(title);tool-use(abstract);workflow(abstract);agentic(abstract)
Comments Technical Report, 14 pages
专题命中 工具调用 :agent(title,abstract);workflow(abstract);agentic(abstract);分类 cs.AI、cs.LG
专题命中 工具调用 :function calling(title,abstract);agent(abstract);agentic(abstract);分类 cs.CL、cs.LG
Comments EMNLP 2024 Demo
专题命中 工具调用 :agent(title,abstract);planning(abstract);multi-agent(abstract);分类 cs.AI、cs.CL
专题命中 工具调用 :agent(title,abstract);tool use(abstract);planning(abstract);分类 cs.AI、cs.CL