Investigate-Consolidate-Exploit: A General Strategy for Inter-Task Agent Self-Evolution
专题命中 工具调用 :agent(title,abstract);AI agent(abstract);planning(abstract);分类 cs.AI、cs.CL
Comments 18 pages, 5 figures
AI 大模型
智能体、工具调用、规划、工作流、多智能体和自主任务执行。
专题命中 工具调用 :agent(title,abstract);AI agent(abstract);planning(abstract);分类 cs.AI、cs.CL
Comments 18 pages, 5 figures
学术研究中的持久性AI智能体:单研究者实施案例研究
机构 * Department of Preventive Medicine and Public Health, Faculty of Medicine, King Abdulaziz University(预防医学与公共卫生系,医学院,国王阿卜杜勒阿齐兹大学)
专题命中 工具调用 :AI agent(title);agentic(abstract,comments);agent(abstract);workflow(abstract)
AI总结 通过单研究者案例研究,分析了持久性AI智能体在真实学术环境中的架构、使用、产出和治理,发现缓存主导的工作流可能将经济单位从每token成本转向每完成工件成本。
Comments 19 pages, 2 figures, 3 main tables; supplementary appendix with 6 tables, 2 figures, and a reproducibility methods section. Describes 17 configured agents in a persistent research environment and introduces the PARE-M (Persistent Agentic Research Environment Measurement) framework
DeepEyesV2:迈向代理多模态模型
专题命中 工具调用 :agentic(title,abstract);tool use(abstract);tool-use(abstract);分类 cs.AI
AI总结 DeepEyesV2通过两阶段训练方法实现代理多模态模型,结合数据构建、训练优化和评估,提升现实世界推理与工具调用能力。
Comments Accepted to ICLR2026. Homepage: https://visual-agent.github.io/
TACO:面向智能体工具使用的工具增强信用优化
专题命中 工具调用 :agentic(title,abstract);tool use(title)
AI总结 提出TACO方法,通过差分答案探针奖励和结果门控优势路由,为代码工具智能体提供无监督工具贡献信用分配,提升多模态问答准确性并减少冗余工具调用。
专题命中 工具调用 :agent(title,abstract);multi-agent(title)
Comments 7 pages, 7 figures, ICRA'24
CTIFoundry:用于网络威胁情报的智能体原生语料库支架
机构 * Virginia Tech(弗吉尼亚理工大学) ; Amazon(亚马逊公司) ; Northwestern University(西北大学)
专题命中 工具调用 :agent(title,abstract);planning(abstract);agentic(abstract);分类 cs.AI
AI总结 CTIFoundry是用于网络威胁情报的智能体原生语料库支架,在CTIConnect基准测试中可使智能体F1提升0.19至0.28,小型模型在其上表现优于旗舰模型,且无需增加搜索工作量。
Comments Preprint
在多物理场AI助手MOOSEnger中部署前沿智能体技术
机构 * Texas A&M University (TAMU)(德克萨斯农工大学) ; Idaho National Laboratory (INL)(爱达荷国家实验室)
专题命中 工具调用 :agentic(title,abstract);agent(abstract);AI agent(abstract);分类 cs.LG
AI总结 本研究为面向MOOSE框架的AI智能体MOOSEnger扩展本地托管模型管控层,经多类工程任务测试,MOOSEnger-GPT-5.2成功率达90%,凸显智能体管控层对多物理场仿真的支撑价值。
重试、切换还是弃权?通过受控错误注入学习策略感知的工具使用策略
机构 * Amazon(亚马逊)
专题命中 工具调用 :tool-use(title,abstract);agent(abstract);tool use(abstract);分类 cs.AI
AI总结 该研究提出BENCH2ROBUST框架,结合BTM与课程强化学习,提升LLM智能体在工具故障下的稳健性,在零售任务中BTM可提稳健性16.8个百分点,二者结合达40.8-45.5%。
智能体技能可能有害:LLM智能体中技能诱导故障的实证研究
机构 * Huazhong University of Science and Technology(华中科技大学) ; Microsoft Research(微软研究院) ; Microsoft(微软) ; University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校)
专题命中 工具调用 :agent(title,abstract);tool use(abstract);planning(abstract);分类 cs.AI
AI总结 本文通过提出差异分析框架,在SkillsBench等数据集上发现LLM智能体的技能会引发功能故障与效率回归,并构建SkillTriage工具,为安全复用技能提供研究方向。
关于智能体大语言模型漏洞的理解、识别与缓解
专题命中 工具调用 :agentic(title,abstract);autonomous agent(abstract);planning(abstract);分类 cs.AI
AI总结 本研究针对智能体大语言模型安全开展系统文献综述,提出四层漏洞分类法,发现攻击研究多于防御研究、感知层漏洞研究占比偏高等现状,识别7个开放问题及架构耦合的核心不安全根源。
从产品搜索到偏好表达:智能体商业的经济学
专题命中 工具调用 :agentic(title,abstract);agent(abstract);AI agent(abstract);分类 cs.AI
AI总结 该研究对比手动与智能体搜索,发现智能体搜索可避免手动搜索的崩溃,存在采用滞后现象,平台对注意力预算大的消费者会采用倒转的保真度分配,智能体商业核心转向偏好表达。
Tangent:基于大语言模型的智能体应用测试实践的实证研究
专题命中 工具调用 :agent(title,abstract);tool use(abstract);agentic(abstract);分类 cs.SE
AI总结 Tangent通过对开源项目和行业从业者的研究,分析了LLM智能体应用的测试现状,发现其以单元测试为主、存在覆盖不足等问题,并提出了相关研究方向。
Comments Accepted at ASE'26
语音函数调用:面向大型音频语言模型的语音理解新视角
机构 * Shanghai Jiao Tong University(上海交通大学) ; Token Foundry, Alibaba Group(阿里巴巴集团Token Foundry) ; Shanghai Innovation Institute(上海创新研究院)
专题命中 工具调用 :function calling(title,abstract);agent(abstract);multi-agent(abstract);分类 cs.CL
AI总结 该研究提出语音函数调用(SFC)这一新型语义理解视角,构建SFC-Bench数据集并评估LLMs与LALMs性能,经后训练提升LALMs的SFC能力,实验显示SFC优于传统SLU,可大幅提升语义提取准确率。
Comments ACM Multimedia 2026
少量神经元可揭示大语言模型何时滥用工具:用于可靠工具使用的稀疏检测与选择性引导
专题命中 工具调用 :tool use(title);agentic(abstract,abstract_cn);tool-use(abstract);分类 cs.CL
AI总结 本研究提出PRISMS框架,利用少量特定MLP神经元实现大语言模型工具使用故障的稀疏检测与选择性引导,可跨模型系列降低过度调用率、提升工具所需准确率。
Comments 21 pages, 4 figures. Includes supplementary material
推理时进行推测:通过联合智能体-推测器强化学习教智能体预测其下一个工具调用
机构 * University of California, Santa Barbara(加利福尼亚大学圣巴巴拉分校) ; Linkedin Inc(领英公司)
专题命中 工具调用 :agent(title,abstract);tool-use(abstract);agentic(abstract);分类 cs.AI
AI总结 研究针对大型语言模型智能体等待工具调用结果时间长的问题,提出联合智能体-推测器强化学习方法,统一智能体和推测器为自推测智能体,复用缓存,提升了Qwen不同模型下一个工具调用的Hit@1指标及任务成功率。
E-Bench:在现实世界产品场景中对多步工具使用智能体进行基准测试
机构 * Hunyuan Team, Tencent(腾讯混元团队) ; Institute for AI Industry Research, Tsinghua University(清华大学人工智能产业研究院) ; School of Computer Science and Engineering, Southeast University(东南大学计算机科学与工程学院)
专题命中 工具调用 :tool-use(title,abstract);agent(abstract);tool use(abstract);分类 cs.AI
AI总结 研究针对大语言模型多步工具使用能力,介绍E-Bench基准测试,通过解耦环境与任务合成构建可扩展可控测试平台,对11个前沿模型测试发现多步工具使用仍具挑战,即便结合代码执行可靠性也不高。
Comments 29 pages, 14 figures, 6 tables
AREX:迈向深度研究的递归自我改进智能体
机构 * Beijing Academy of Artificial Intelligence (BAAI)(北京通用人工智能研究院)
专题命中 工具调用 :agent(title,abstract);tool-use(abstract);agentic(abstract);分类 cs.AI
AI总结 该研究针对深度研究中发现与验证答案的不对称性,提出递归自我改进智能体AREX。它通过内部研究与外部自我改进循环交替工作,学习自主上下文更新工具,经训练后在多个基准测试中显著优于同等规模基线,与参数更多模型竞争。
核磁共振解析作为一个智能体搜索问题,而非建模问题
专题命中 工具调用 :agentic(title,abstract);agent(abstract);autonomous agent(abstract);分类 cs.LG
AI总结 研究针对NMR数据结构解析这一化学等领域的瓶颈,构建由冻结语言模型支持的自主智能体,将其解析过程视为受限搜索而非建模任务,在多个数据集上取得良好结果,为自动化光谱分析的多步骤编排框架提供了方向。
智能体需要语义元数据吗?智能体数据检索的比较研究
机构 * Google(谷歌)
专题命中 工具调用 :agentic(title,abstract);agent(abstract);autonomous agent(abstract);分类 cs.AI
AI总结 通过对比基线智能体(搜索开放网络)与语义智能体(利用schema.org元数据)在数据检索中的表现,发现语义元数据在检索可操作数据时精度更高(整体精度高65.7%),而基线智能体覆盖更广但存在“最后一英里效用”失败。
章鱼v2:用于超级代理的设备端语言模型
机构 * Stanford University(斯坦福大学)
专题命中 工具调用 :agent(title);AI agent(abstract);workflow(abstract);function calling(abstract)
AI总结 章鱼v2通过设备端20亿参数模型,在准确性和延迟上超越GPT-4,同时将上下文长度减少95%,提升边缘设备应用性能。
量化预算约束下代理LLM搜索中的准确性与成本影响
专题命中 工具调用 :agentic(title,abstract);tool use(abstract);planning(abstract);分类 cs.AI
AI总结 本研究探讨了预算约束下代理LLM搜索中搜索深度、检索策略和完成预算对准确性和成本的影响,并提供了可重复的评估方法和实验结果。
Comments Accepted in 2026 Language Resources and Evaluation Conference (LREC)
UNIBROWSE:用于多模态浏览比较的数据到智能体框架
机构 * Key Laboratory of Computational Linguistics, MOE, Peking University(教育部计算语言学重点实验室,北京大学) ; School of Software and Microelectronics, Peking University(北京大学软件与微电子学院) ; School of Computer Science, Peking University(北京大学计算机科学学院)
专题命中 工具调用 :agent(title,abstract);tool use(abstract);tool-use(abstract);分类 cs.CL
AI总结 研究多模态浏览比较任务,提出UNIBROWSE统一数据管道,同时生成三种模式训练数据,增强知识图谱,引入探索度度量。经此训练的35B规模智能体在多模态浏览比较基准测试中性能领先,超多个闭源智能体工作流程。
Comments 17 pages, 5 figures
存在但重新缩放:加法激活引导的聊天到智能体的转移
专题命中 工具调用 :agent(title,abstract);tool-use(abstract);agentic(abstract);分类 cs.LG
AI总结 研究加法激活引导从聊天到智能体的转移,通过匹配信息设计进行研究,发现转移真实但重新缩放,确定了加法特定机制,定位了重新缩放位置,指出智能体部署对引导拒绝绕过影响不可预测。
Comments 12 pages, 3 figures, 4 tables
智能体数据环境
机构 * Columbia University(哥伦比亚大学)
专题命中 工具调用 :agentic(title,abstract);agent(abstract);autonomous agent(abstract);分类 cs.AI
AI总结 探讨智能体数据环境,其作为智能体运行的执行基础,既能增强智能体能力又保障安全。该环境拓宽了智能体运行的数据范围,改变了对数据系统的传统认知,有望在提升智能体效能同时控制故障成本。
Journal ref IEEE Data Bulletin Vol. 50 No. 1 2026
超越静态评估:构建用于可扩展智能体强化学习的模拟环境
机构 * Uber AI Solutions(优步人工智能解决方案)
专题命中 工具调用 :agentic(title);agent(abstract);autonomous agent(abstract);tool use(abstract)
AI总结 研究针对大语言模型成为自主智能体后传统静态评估失效的问题,引入AgenticAI-Supervisor平台,通过API和UI驱动构建强化学习环境,运用可验证执行结果、多维奖励塑造及严格验证测试,以客户支持智能体案例展示核心能力及未来工作重点。
智能体人工智能-RAN:实现意图驱动、可解释和自我进化的开放式RAN智能
机构 * G/6GIC, Institute for Communication Systems (ICS), University of Surrey(5G/6G研究所,通信系统研究所(ICS),萨里大学) ; G Research Center, Khalifa University(6G研究中心,卡利法大学)
专题命中 工具调用 :agentic(title,abstract);tool use(abstract);planning(abstract);分类 cs.LG
AI总结 探讨如何将智能体控制器引入开放式RAN,介绍相关架构,对比传统ML/RL xApps,围绕网络切片生命周期等任务分类,引入智能体原语并展示其在多小区O-RAN模拟中提升性能,还讨论了安全等挑战。
Comments 11 pages, 4 figures. Accepted at IEEE Network Magazine
DEEPMED Search: 一个具有内省验证功能的开源医学深度研究智能体平台
机构 * School of Computer Science and Software Engineering, Shanghai University(上海大学计算机科学与软件工程学院) ; Department of Computer Science and Engineering, Shanghai Jiao Tong University(上海交通大学计算机科学与工程系)
专题命中 工具调用 :agentic(title,abstract);agent(abstract);multi-agent(abstract);分类 cs.AI
AI总结 提出一个开源智能体平台DEEPMED Search,通过源自适应路由和内省验证模块,自动分解复杂医学查询并生成结构化报告,解决异构医疗数据检索中的推理漂移问题。
Comments 5 pages, 2 figures, 2 tables. Accepted to IJCAI-ECAI 2026 Demo Track. Project website: https://www.deepmedsearch.cloud. Demo video: https://youtu.be/4U4aok8yLpk
AI告密者出故障:走向规避智能体监控
机构 * University of Massachusetts Amherst(马萨诸塞大学阿默斯特分校)
专题命中 工具调用 :agentic(title,abstract);agent(abstract);AI agent(abstract);分类 cs.AI
AI总结 本文提出智能体监控问题,创建SurveilBench数据集评估模型监控能力,并开发三种规避技术(隐藏、欺骗、诱导过度升级)以保护用户。
Comments The code and Demo are available at https://aisec.cs.umass.edu/demo/ai-snitches-get-stitches/
代理网络的基础设施:来自Agentverse平台的差距分析与架构
机构 * OpenHub Research(开放 hub 研究)
专题命中 工具调用 :agentic(title,abstract);agent(abstract);AI agent(abstract);分类 cs.AI
AI总结 本文通过实证审计Agentverse平台,识别出8类62项缺失能力,提出七层代理云栈参考架构,并规划了从存储到经济原语的五条关键演进路径,为2030年实现Web4代理云提供技术路线。
Comments 28 pages, 11 tables, 1 figure. Preprint, not peer-reviewed
AI代理的运行时合规性验证
专题命中 工具调用 :AI agent(title,abstract);agent(abstract);tool use(abstract);分类 cs.SE
AI总结 提出C-Trace框架,通过运行时监控和形式化策略谓词,确保AI代理在工具调用和对话中遵守GDPR规则,将攻击成功率降至12%以下。