PentestJudge: Judging Agent Behavior Against Operational Requirements
机构 * dreadnode
专题命中 工具调用 :agent(title,abstract);tool-use(abstract);分类 cs.AI
Comments 18 pages, 5 figures, 3 tables
AI 大模型
智能体、工具调用、规划、工作流、多智能体和自主任务执行。
机构 * dreadnode
专题命中 工具调用 :agent(title,abstract);tool-use(abstract);分类 cs.AI
Comments 18 pages, 5 figures, 3 tables
机构 * Shanghai Jiaotong University(上海交通大学) ; Shanghai Artificial Intelligence Laboratory(上海人工智能实验室) ; The Chinese University of Hong Kong(香港中文大学) ; Wuhan University(武汉大学)
专题命中 工具调用 :agentic(title,abstract);function calling(abstract);分类 cs.AI
Comments project url: https://github.com/Liuziyu77/Visual-RFT/tree/main/Visual-ARFT
机构 * Fudan University(复旦大学) ; ByteDance(字节跳动) ; Shanghai Collaborative Innovation Center of Intelligent Visual Computing(上海智能视觉计算协同创新中心)
专题命中 工具调用 :tool use(title,abstract);tool-use(abstract);分类 cs.CL
Comments Accepted by ACL 2025 Main Conference
机构 * Tongji University(同济大学) ; East China Normal University(华东师范大学) ; University of Minnesota(明尼苏达大学)
专题命中 工具调用 :agentic(title,abstract);workflow(abstract);分类 cs.AI
Comments 27 pages, 5 figures
专题命中 工具调用 :agentic(title,abstract);AI agent(abstract);分类 cs.AI
Comments 11 pages, perspective paper
机构 * EPFL(洛桑联邦理工学院)
专题命中 工具调用 :tool use(title,abstract);planning(abstract);分类 cs.CL
专题命中 工具调用 :function calling(title,abstract);agentic(abstract);分类 cs.LG
Comments Accepted at DATE 2025
专题命中 工具调用 :function calling(title,abstract);agent(abstract);分类 cs.AI
专题命中 工具调用 :function calling(title,abstract);tool use(abstract);分类 cs.AI
Comments 15 pages for main paper, 21 pages in total including references and appendix, 10 figures
专题命中 工具调用 :agent(title,abstract);workflow(abstract);分类 cs.AI
专题命中 工具调用 :tool-use(title,abstract);tool use(abstract);分类 cs.CL
专题命中 工具调用 :tool-use(title,abstract);planning(abstract);分类 cs.AI
Journal ref IEEE Robotics and Automation Letters, 2022
专题命中 工具调用 :planning(title,abstract);agent(abstract);分类 cs.AI
专题命中 工具调用 :planning(title,abstract);agent(abstract);分类 cs.AI
Comments arXiv admin note: substantial text overlap with arXiv:1505.05947
专题命中 工具调用 :agent(title,abstract);multi-agent(abstract);分类 cs.AI
Comments 7 pages
LLM智能体故障的实时检测与修复
专题命中 工具调用 :agent(title,abstract);分类 cs.AI、cs.LG、cs.SE
AI总结 该研究提出基于LLM智能体步骤遥测的实时故障检测与修复系统,结合单类回声状态网络集成与确定性验证层,可高效检测并修复故障,提升任务成功率且成本极低。
Comments 16 pages, 5 figures. Code, data and demo: github.com/sunnydubey1111/agent-trajectory-sentinel Walkthrough: youtu.be/a05n_000klE
专题命中 工具调用 :agent(title,abstract);分类 cs.AI、cs.CL、cs.LG
Comments Code, data, and models are available at https://fireact-agent.github.io
TRACE:面向一致性、极限感知的自进化技能库
机构 * Xiaomi Inc.(小米公司) ; Nanjing University(南京大学) ; Beijing University of Posts and Telecommunications(北京邮电大学) ; Tsinghua University(清华大学)
专题命中 工具调用 :agent(abstract);tool use(abstract);tool-use(abstract);agentic(abstract)
AI总结 TRACE是一种无需修改模型权重的自进化技能库方法,通过轨迹对比进化优化技能,在CAR-bench任务上显著提升LLM智能体的一致性性能,缩小潜在与可靠性能的差距。
Comments 9 pages, 5 figures, 2 tables
通过溯源分析保护LLM智能体免受失调影响
机构 * Carnegie Mellon University(卡内基梅隆大学)
专题命中 工具调用 :agent(summary_cn,abstract);分类 cs.AI、cs.CL
AI总结 提出基于溯源分析的ProvenanceGuard框架,通过多阶段流水线检测工具调用前的三种失调类型,在Agent-SafetyBench和WorkBench上显著降低失调错误率并减少不必要的干预。
Agentland中的恶意行为:深入AI供应链后门问题
机构 * ServiceNow Research ; Mila - Qu\'ebec AI Institute
专题命中 工具调用 :agent(abstract);AI agent(abstract);tool use(abstract);agentic(abstract)
AI总结 研究探讨了在交互数据上微调AI代理时引入的安全漏洞,提出三种供应链威胁模型,证明通过污染少量演示即可使代理泄露用户信息。
Comments 27 pages
认知控制架构(CCA):一种用于鲁棒对齐AI代理的生命周期监督框架
机构 * Sichuan University(四川大学)
专题命中 工具调用 :agent(abstract);tool-use(abstract);planning(abstract);agentic(abstract)
AI总结 本文提出认知控制架构(CCA),通过全生命周期认知监督框架,有效应对复杂IPI攻击,实现安全、功能与效率的平衡。
单子上下文工程
机构 * IIIS, Tsinghua University(清华大学人工智能研究院)
专题命中 工具调用 :agent(abstract);AI agent(abstract);autonomous agent(abstract);tool use(abstract)
AI总结 本文提出Monadic Context Engineering,利用函子、应用函子和单子的代数结构,为智能体设计提供形式基础,通过分层方法构建高效可靠的AI智能体。
Comments We found some issues in the categorical foundations of this work, so we respectfully withdraw it
SVFSearch: 一种面向游戏垂直领域的多模态知识密集型短视频帧搜索基准
机构 * Kuaishou Technology(快手科技)
专题命中 工具调用 :agent(abstract);tool-use(abstract);workflow(abstract);agentic(abstract)
AI总结 本文提出SVFSearch,首个针对中文游戏领域短视频帧搜索的多模态知识密集型基准,通过5000个四选一测试示例和4198个辅助训练示例,评估了从直接问答到计划-行动-重新计划代理等多种方法在短视频帧搜索中的性能。
机构 * Technische Universität München(慕尼黑技术大学) ; Jessy Works(杰西工作)
专题命中 工具调用 :autonomous agent(title);agent(abstract,journal_ref);分类 cs.AI、cs.SE;multi-agent(journal_ref)
Journal ref The Second International Workshop on Hypermedia Multi-Agent Systems (HyperAgents 2025), in conjunction with the 28th European Conference on Artificial Intelligence (ECAI 2025); October 26, 2025, Bologna, Italy
专题命中 工具调用 :agent(abstract,comments);tool use(abstract);tool-use(abstract);agentic(abstract)
Comments https://tongyi-agent.github.io/blog/introducing-tongyi-deep-research/
Apodex 1.1:为复杂工作扩展智能体智能
专题命中 工具调用 :agentic(title,abstract);分类 cs.AI、cs.CL、cs.LG
AI总结 Apodex 1.1 从环境扩展与智能体协调扩展两维度开发工作能力,在多领域复杂任务中性能领先,其 350亿参数的 Mini 版本可本地部署,助力构建长周期任务的重型求解器。
面向智能体工具检索的风险感知重排序
专题命中 工具调用 :agentic(title);agent(abstract);tool-use(abstract)
AI总结 本文针对智能体工具检索的风险问题,提出轻量级风险感知重排序框架,通过权衡安全与效用改善相关性-安全 tradeoff,为安全关键部署提供保守操作点。
Comments Accepted by CIKM 2026
将BrowseComp-Plus映射到ClimbMix:构建更符合智能体搜索需求的真实语料库
专题命中 工具调用 :agentic(title,abstract);agent(abstract)
AI总结 该研究将BrowseComp-Plus的查询映射到NVIDIA的ClimbMix语料库,构建了与基准无关的映射流水线,生成57个有效查询,使智能体搜索难度向检索环节转移,发布了相关资源。
通过带保障的声明式智能体编程学习用于语法约束解码的上下文无关文法
专题命中 工具调用 :agentic(title);agent(abstract);分类 cs.AI、cs.CL、cs.SE
AI总结 本研究提出名为Autogrammar的声明式智能体,可从文档和执行数据自动学习上下文无关文法,用于语法约束解码,在三种DSLs上的实验显示其生成的文法性能优于现有基线,能显著提升端到端LM的真实任务表现。
Comments 9 pages, 3 figures, 2 tables
KernelBrain:面向智能体的GPU内核优化的粗到细、预算感知搜索
机构 * Microsoft(微软公司)
专题命中 工具调用 :agentic(title);agent(abstract);分类 cs.AI、cs.LG、cs.SE
AI总结 KernelBrain是结合LLM引导变异等技术的GPU内核优化智能体,可提升内核质量与搜索效率,在Triton内核任务中获多倍加速且缩短优化时间。