Towards Real-Time Search Planning in Subsea Environments
专题命中 工具调用 :planning(title);分类 cs.AI
Comments 8 pages, 5 figures. Submitted to 2017 IEEE/RSJ International Conference on Intelligent Robots and Systems (IROS 2017)
AI 大模型
智能体、工具调用、规划、工作流、多智能体和自主任务执行。
专题命中 工具调用 :planning(title);分类 cs.AI
Comments 8 pages, 5 figures. Submitted to 2017 IEEE/RSJ International Conference on Intelligent Robots and Systems (IROS 2017)
专题命中 工具调用 :planning(title);分类 cs.AI
Journal ref In Proceedings of the AAAI Conference on Artificial Intelligence and Interactive Digital Entertainment (AIIDE), pp. 2-8, 2015
专题命中 工具调用 :agent(title);分类 cs.AI
专题命中 工具调用 :agent(title);分类 cs.AI
Comments In the proceedings of First International Workshop on Cultural Heritage on the Semantic Web in conjunction with the 6th International Semantic Web Conference and the 2nd Asian Semantic Web Conference 2007, (ISWC + ASWC 2007), P 117, 12-15 November 2007
朴素提示优化:重新思考复杂提示搜索的必要性
机构 * Purdue University(普渡大学)
专题命中 工具调用 :autonomous agent(abstract);agentic(abstract);分类 cs.AI、cs.CL
AI总结 该研究提出轻量级朴素提示优化(NPO),发现其性能优于复杂优化器GEPA,且优化后的提示可迁移至同系列其他模型,表明简单线性提示优化可媲美复杂搜索方法。
Comments 22 pages, 12 figures
SpeechGym:一种用于通过强化学习训练语音智能体的原生音频 Gym
机构 * University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) ; Amazon AGI Foundations(亚马逊AGI基础研究部)
专题命中 工具调用 :agent(abstract);agentic(abstract);分类 cs.AI、cs.CL
AI总结 研究针对语音智能体训练中梯度无法流动、难以强化学习的问题,提出原生音频环境 SpeechGym,用每轮过程奖励解决稀疏性问题,使开放权重模型在语音基准上任务成功率翻倍且排名提升。
学习搜索的艺术以实现自动发现
机构 * University of California, Santa Barbara(加州大学圣塔芭芭拉分校) ; Université de Montréal and Mila- Quebec AI Institute(蒙特利尔大学和Mila-魁北克人工智能研究所)
专题命中 工具调用 :agent(abstract);agentic(abstract);分类 cs.AI、cs.CL
AI总结 提出ARTS方法,利用推理语言模型在假设与实验空间中迭代搜索,通过测试时训练解决上下文长度问题,在22个任务上优于现有算法,相对提升超15.3%。
PeakBench:面向大语言模型智能体的资源感知工具调用基准测试
机构 * School of Artificial Intelligence, Nanjing University(南京大学人工智能学院) ; Nanjing University(南京大学)
专题命中 工具调用 :agent(abstract);planning(abstract);分类 cs.AI、cs.SE
AI总结 PeakBench是面向LLM智能体的资源感知工具调用基准,通过两部分评估框架解耦逻辑规划与物理调度,实验表明资源信息可减少溢出、提升利用率,为相关研究提供测试平台。
ToolRobustBench:工具调用智能体的分阶段扰动评估与故障诊断
专题命中 工具调用 :agent(abstract);tool-use(abstract);分类 cs.AI、cs.SE
AI总结 本研究推出ToolRobustBench,这一工具调用智能体的分阶段诊断基准,通过四类扰动族评估7个模型等的15456个实例,发现工具输出/观测扰动是主要瓶颈,可诊断工具调用故障来源与传播。
Enrich-Retrieve-Rank:将能力发现扩展至上下文路由之外
机构 * Amazon AGI(亚马逊AGI)
专题命中 工具调用 :agent(abstract);multi-agent(abstract);分类 cs.AI、cs.CL
AI总结 该研究提出Enrich-Retrieve-Rank流程,将能力发现从上下文路由扩展,经实验验证其在大规模MATS组件场景下,比Full-Ctx、Search&Pick基线性能更优且成本更低,已作为多智能体平台的默认能力发现层投入生产。
Comments 11 pages, 4 figures, and 12 tables
利用算子链实现上下文算子学习
机构 * Department of Mathematics, Shanghai Normal University(上海师范大学数学系) ; Department of Mathematics, National University of Singapore(新加坡国立大学数学系)
专题命中 工具调用 :tool use(abstract);agentic(abstract);分类 cs.AI、cs.LG
AI总结 提出Chain of Operators (CHOP)框架,通过构造显式初等变换与冻结ICON的算子链,无需微调即可提升上下文算子网络在分布外算子任务上的泛化能力,在标量守恒律和平均场控制问题中降低推理误差。
相同载荷,不同通道:测量使用工具的語言模型中的信任不对称性
机构 * University of Arizona(亚利桑那大学)
专题命中 工具调用 :agent(abstract);agentic(abstract);分类 cs.CL、cs.LG
AI总结 本研究提出安全不对称分数(SAS),通过匹配恶意载荷仅改变传递上下文,系统测量了语言模型在不同通道(用户消息、工具元数据、工具输出)中对对抗性内容的脆弱性差异,发现代理原生模型在工具描述通道更脆弱,而通用模型相反,且机制研究表明安全相关表示在深层网络非线性编码。
Comments Accepted to EMNLP 2026 (Main Conference)
在LLM代理中通过帮助性优化保持安全性训练
机构 * Department of Computer Science, University of California, Berkeley, USA(计算机科学系,加州大学伯克利分校)
专题命中 工具调用 :tool-use(abstract);agentic(abstract);分类 cs.CL、cs.LG
AI总结 研究通过帮助性优化在LLM代理中保持安全性训练,发现单独训练或依次训练无法找到最佳策略,但所有配置接近帕累托前沿。
Comments Preprint
IACDM:交互对抗收敛开发方法论——面向AI辅助软件开发的结构化框架
专题命中 工具调用 :agent(abstract);tool use(abstract);分类 cs.AI、cs.SE
AI总结 本文提出IACDM方法论,通过外部验证代理解决AI生成应用中的验证缺口问题,强调通过层次语义分析、知识管理及系统对抗批评提升软件开发质量。
Comments 37 pages, 7 tables. Technical Foundation Document. v3 adds a pre-registered experiment testing lens non-redundancy over 12 projects, and withdraws the retrospective analysis of v1-v2 (defective instrument). Data: https://doi.org/10.5281/zenodo.21908908 Repo: https://github.com/jasminemoreira/Versus
通过大语言模型的战略搜索实现自动化设计优化
专题命中 工具调用 :agent(abstract);planning(abstract);分类 cs.AI、cs.LG
AI总结 本研究提出AUTO框架,利用大语言模型的战略搜索实现GPU代码优化,提升搜索效率并降低成本。
Comments 16 pages, 4 tables, 8 figures, preprint
恢复自动研究智能体中浪费的计算资源
机构 * Columbia University(哥伦比亚大学) ; Georgetown University(乔治城大学) ; Capital One(第一资本金融公司)
专题命中 工具调用 :agent(abstract);agentic(abstract);分类 cs.AI、cs.LG
AI总结 本文针对自动研究智能体应用于表格数据集时的四类计算资源浪费问题,提出针对性干预措施,仅通过优化智能体设计即可大幅提升其性能。
DOCSCHISEL:面向大语言模型智能体的自适应工具文档优化框架
专题命中 工具调用 :agent(abstract);tool-use(abstract);分类 cs.AI、cs.LG
AI总结 该研究针对LLM智能体工具文档的异质性与泛化问题,提出DocsChisel自适应优化框架,经实验较原始文档及EasyTool、DRAFT基线大幅提升任务成功率,且开销有限。
有特权但有偏差:PI条件化教师如何破坏自蒸馏
机构 * Microsoft Research(微软研究院)
专题命中 工具调用 :tool use(abstract);agentic(abstract);分类 cs.AI、cs.LG
AI总结 该研究发现,以特权信息为条件的自蒸馏在低难度任务上有效,但在困难任务上会因特权信息偏差导致模型推理能力下降,其优化信号与任务成功脱钩。
搜索、检查、获取:利用布尔检索构建深度研究智能体
机构 * The University of Queensland(昆士兰大学) ; CSIRO(联邦科学与工业研究组织)
专题命中 工具调用 :agent(abstract);workflow(abstract);分类 cs.AI、cs.CL
AI总结 本研究针对现有深度研究智能体的缺陷,提出基于BQL的SIEVE接口,在三个问答数据集上实现更高准确率且token用量显著减少,验证了BQL过滤的有效性。
Comments added statistical test, restructure appendix etc
自进化推荐系统:基于LLM代理的端到端自主模型优化
机构 * Google Inc(谷歌公司)
专题命中 工具调用 :agent(abstract);workflow(abstract);分类 cs.AI、cs.LG
AI总结 本文提出了一种基于LLM代理的自进化推荐系统,通过端到端自动化流程自主优化模型,提升开发效率和性能。
Comments RecSys 2026
分数并非决策:大语言模型智能体工具获取的成本感知停止策略
专题命中 工具调用 :agent(abstract);tool-use(abstract);分类 cs.AI、cs.LG
AI总结 针对LLM智能体工具获取的异构成本问题,提出CAM-DF及其轻量变体,通过训练停止决策的离线差距实现成本感知停止,在1343个任务上验证其优于基线,减少工具接触量的同时保持任务成功率。
奇妙的自适应分类法及其使用方法
机构 * University of California, Berkeley(加州大学伯克利分校) ; Apple(苹果公司) ; Bespoke Labs(Bespoke实验室)
专题命中 工具调用 :agent(abstract);workflow(abstract);分类 cs.AI、cs.SE
AI总结 研究智能体系统失败反馈问题,提出AdaMAST方法将轨迹转换为自适应失败分类法,该分类法能作为共享反馈接口,在智能体系统搜索、运行时及轨迹选择等方面改进智能体,提升准确率和分辨率。
ClinFusion:用于整体医学理解的以视觉为中心的多模态大语言模型系统
机构 * DAMO Academy, Alibaba Group(达摩院,阿里巴巴集团) ; Hupan Laboratory(湖畔实验室) ; College of Computer Science and Technology, Zhejiang University(浙江大学计算机科学与技术学院) ; Department of Computer Science and Technology, Tsinghua University(清华大学计算机科学与技术系) ; Department of Radiology, The Affiliated Yangming Hospital of Ningbo University(宁波大学附属阳明医院放射科) ; Zhejiang University-University of Illinois Urbana-Champaign Institute, Zhejiang University(浙江大学伊利诺伊大学厄巴纳香槟校区联合学院,浙江大学) ; Hepato-Pancreato-Biliary Center, Beijing Tsinghua Changgung Hospital, School of Clinical Medicine, Tsinghua Medicine, Tsinghua University(清华长庚医院肝胆胰中心,清华大学临床医学院,清华医学,清华大学) ; School of Software, Tsinghua University(清华大学软件学院) ; Beijing National Research Center for Information Science and Technology, Tsinghua University(清华大学北京信息科学与技术国家研究中心)
专题命中 工具调用 :tool use(abstract);agentic(abstract);分类 cs.AI、cs.CL
AI总结 研究针对多模态大语言模型在医学领域部署的挑战,提出ClinFusion,采用组合级联视觉编码器架构和视觉基础评估框架,在多模态医学基准测试中表现优异,超越开源和专有模型,经专家盲评验证效果良好。
Comments Code: https://github.com/alibaba-damo-academy/ClinFusion Models: https://huggingface.co/collections/Alibaba-DAMO-Academy/clinfusion
量化思维多样性:加权大语言模型集成提升的预测定律
机构 * The Alan Turing Institute(艾伦·图灵研究所)
专题命中 工具调用 :tool use(abstract);agentic(abstract);分类 cs.AI、cs.LG
AI总结 研究量化思维多样性在大语言模型集成中提升效果的预测定律,通过原理推导得出计算提升的启发式方法及相关指标,经多基准测试验证,该方法能有效预测集成性能,且准确性调整后的指标表现更优。
ToolSciVer:基于视觉工具增强强化学习的多模态科学声明验证
机构 * The Pennsylvania State University(宾夕法尼亚州立大学) ; University of Waterloo(滑铁卢大学)
专题命中 工具调用 :tool use(abstract);tool-use(abstract);分类 cs.AI、cs.CL
AI总结 研究多模态科学声明验证问题,提出ToolSciVer框架,为视觉语言模型配备三种类型感知视觉工具,用组相对策略优化训练策略,实验证明该方法在多模型上性能优于竞争基线。
服务代理何时应重新考虑?客户服务运营中的难度路由控制
机构 * The Pennsylvania State University(宾夕法尼亚州立大学)
专题命中 工具调用 :tool-use(abstract);workflow(abstract);分类 cs.AI、cs.CL
AI总结 提出一种难度路由的服务控制架构,通过轻量级路由器将常规会话与操作耦合会话分流,在关键后端写入前集中审查,提升零售和航空任务的可靠性。
SPADER: 面向多答案问答的逐步同伴优势与多样性感知探索奖励
机构 * State Key Lab of CAD&CG, Zhejiang University(浙江大学CAD与CG国家重点实验室) ; School of Software and Microelectronics, Peking University(北京大学软件与微电子学院) ; School of Software Technology, Zhejiang University(浙江大学软件技术学院)
专题命中 工具调用 :tool use(abstract);tool-use(abstract);分类 cs.AI、cs.CL
AI总结 提出SPADER强化学习框架,通过逐步同伴优势(SPA)机制和多样性感知探索奖励,解决多答案问答中长程工具使用的细粒度信用分配与持续探索问题,实验表明在多个数据集上提升了召回率和F1分数。
AI采纳与能力的开源经济指数
机构 * University of Michigan(密歇根大学) ; AT&T Chief Data Office(AT&T首席数据办公室) ; IFM-MBZUAI
专题命中 工具调用 :AI agent(abstract,abstract_cn);分类 cs.AI、cs.LG
AI总结 通过公开聊天数据和O*NET任务构建开源经济指数,衡量AI在各职业的采纳率与任务执行能力,发现金融、计算机和艺术行业采纳率最高。
AdversaBench: 基于多裁判确认与跨模型迁移性的自动化大语言模型红队测试
机构 * Indian Institute of Technology Jodhpur(印度理工学院焦特布尔分校)
专题命中 工具调用 :tool use(abstract);tool-use(abstract);分类 cs.AI、cs.CL
AI总结 提出AdversaBench端到端红队测试流水线,使用五种结构化算子变异种子提示,通过三裁判加元裁判机制确认失败,实验发现算子效果因类别而异、二元失败率掩盖难度、裁判一致性受标签偏斜影响、对抗提示可跨模型迁移。
Comments 10 pages, 4 figures, 5 tables. Code and data at https://github.com/khanak0509/AdversaBench
通过策略拍卖扩展小型智能体
机构 * Meta Superintelligence Labs(Meta超智能实验室) ; Imperial College London(帝国理工学院伦敦分校) ; University of Cambridge(剑桥大学)
专题命中 工具调用 :agent(abstract);agentic(abstract);分类 cs.AI、cs.CL
AI总结 针对小型语言模型在复杂任务中性能不足的问题,提出受自由职业市场启发的SALE框架,通过策略拍卖实现任务分配与测试时自我改进,在降低对大型模型依赖和成本的同时提升性能。
Comments ICML 2026