Agentic Systems: A Guide to Transforming Industries with Vertical AI Agents
专题命中 Agent评测 :AI agent(title,abstract);agentic(title,abstract);agent(abstract)
Comments 31 pages, 5 figures
AI 大模型
智能体、工具调用、规划、工作流、多智能体和自主任务执行。
专题命中 Agent评测 :AI agent(title,abstract);agentic(title,abstract);agent(abstract)
Comments 31 pages, 5 figures
专题命中 Agent评测 :agent(title,abstract);AI agent(title,abstract);multi-agent(abstract)
专题命中 Agent评测 :AI agent(title,abstract);agentic(title,abstract);分类 cs.AI、cs.CL;agent(journal_ref)
Comments 9 pages
Journal ref 7th International Workshop on Agent-Based Modelling of Human Behaviour (ABMHuB'25), ALife 2025
重新审视Agentic-SQL:面向LLM文本转SQL的基于自主性的分类与实证基准分析
专题命中 Agent评测 :agentic(title,title_cn);agent(abstract_cn);分类 cs.AI
AI总结 本研究针对LLM文本转SQL领域,构建基于自主性的分类框架,通过Spider案例研究分析8B开源模型与DeepSeek-V3等基线的表现,发布工具链用于构建可追溯的基准排行榜。
ReMMD: 面向多模态虚假信息检测的现实多语言多图像智能体验证
机构 * Shanghai Jiaotong University(上海交通大学) ; Shanghai Artificial Intelligence Laboratory(上海人工智能实验室) ; Tsinghua University(清华大学) ; Central South University(中南大学) ; China Electronics Technology Group Corporation 15th Research Institute(中国电子科技集团公司第十五研究所)
专题命中 Agent评测 :agent(summary_cn,abstract);agentic(title,abstract);分类 cs.AI
AI总结 提出ReMMD框架,包含多语言多图像基准ReMMDBench和持久记忆验证器ReMMD-Agent,通过原子点分解和可重用证据集实现高效准确的多模态虚假信息检测。
Comments The project is available at https://dang-ai.github.io/ReMMD
AgenticPD:用于物理设计QoR优化的阶段感知智能体框架
专题命中 Agent评测 :agent(summary_cn,abstract);agentic(title,abstract);分类 cs.AI
AI总结 针对物理设计QoR优化难题,现有方法欠佳。提出AgenticPD框架,围绕物理设计流程阶段边界组织,利用Judge Agent引导搜索,阶段专用智能体借助本地工具做决策,提升优化效果。
Comments 7 pages, 6 figures
用于代理网络运维和AI运维的大型语言模型:架构、评估与安全
机构 * School of Computing and Communications(计算与通信学院) ; University of Cambridge(剑桥大学) ; School of Software(软件学院) ; Nanjing University of Information Science and Technology(南京信息科技大學) ; TU Wien(维也纳技术大学) ; ICREA
专题命中 Agent评测 :agentic(title,abstract);agent(abstract);tool use(abstract);planning(abstract)
AI总结 本文探讨了大型语言模型在网络运维和AI运维中的应用,分析了代理架构、评估方法及安全挑战,强调系统可靠性依赖于模型周边机制,而非模型本身。
Comments 49 pages, 15 figures, 6 tables; survey article
AI Agents May Always Fall for Prompt Injections
机构 * ELLIS Institute Tübingen & MPI-IS & Tübingen AI Center(图宾根ELLIS研究所及MPI-IS与图宾根人工智能中心) ; University of Massachusetts Amherst(马萨诸塞大学阿默斯特分校)
专题命中 Agent评测 :AI agent(title,title_cn);agent(abstract);autonomous agent(abstract);分类 cs.CL
AI总结 本文基于上下文完整性理论重新审视提示注入问题,揭示了现有防御机制的不足,并提出了一种新的评估框架来设计更安全的自主代理。
治理你无法观察的事物:面向自主AI代理的自适应运行时治理
机构 * Department of Computing, University of Turku(图尔库大学计算机系)
专题命中 Agent评测 :agent(summary_cn,abstract);AI agent(title,abstract);分类 cs.AI
AI总结 本文提出信息有效性原理,通过估计未观察风险上界并设定安全余量,实现自主AI代理的自适应运行时治理,结合Aubin viability理论构建Agent有效性框架,引入风险门机制实现预测性治理。
AgencyBench:在100万token现实场景中自主代理的前沿评估
机构 * SII Open Source(SII开源)
专题命中 Agent评测 :autonomous agent(title,abstract);agent(abstract,abstract_cn);tool-use(abstract);agentic(abstract)
AI总结 本文提出AgencyBench,通过138个现实场景评估6种核心代理能力,揭示闭源模型在资源效率和反馈修正上的优势,为下一代自主代理的发展提供测试平台。
Comments Accepted by ACL 2026 Main Conference
机构 * University of Maryland College Park(马里兰大学学院公园分校) ; Lawrence Livermore National Laboratory(劳伦斯利弗莫尔国家实验室) ; Capital One
专题命中 Agent评测 :agentic(title,abstract);agent(abstract);autonomous agent(abstract);workflow(abstract)
Comments ICLR 2025 Workshop BuildingTrust
专题命中 Agent评测 :AI agent(title,abstract);agent(abstract);autonomous agent(abstract);agentic(abstract)
专题命中 Agent评测 :AI agent(title,abstract);agent(abstract);autonomous agent(abstract);agentic(abstract)
测量持续存在的内容:AI智能体身份的调节机制与几何框架
机构 * Anisotrope AI
专题命中 Agent评测 :agent(title,abstract);AI agent(title,abstract);分类 cs.AI、cs.CL
AI总结 提出基于√JSD度量空间和丰富范畴理论中幅度同调的几何框架,用于测量AI智能体身份结构,发现双机制调节结构:身份真空簇和安全盆地簇,并通过等边探针基线验证身份规范创造可测量的行为丰富性。
Comments 29 pages, 6 figures, 8 tables
STT-Arena:一种更现实的工具使用环境,包含时空动态
机构 * Hong Kong Institute of AI for Science, City University of Hong Kong(香港人工智能科学研究院,香港城市大学) ; Department of Data Science, City University of Hong Kong(数据科学系,香港城市大学) ; Beijing University of Posts and Telecommunications(北京邮电大学) ; Li Auto Inc.(李汽有限公司) ; Independent Researcher(独立研究者)
专题命中 Agent评测 :agent(summary_cn,abstract);tool-use(abstract,abstract_cn);agentic(abstract);分类 cs.AI、cs.CL
AI总结 本文提出STT-Arena基准测试,旨在评估大型语言模型在面对时空动态变化时的适应性规划能力,发现现有模型在处理此类动态问题时存在显著不足,并提出改进方法STT-Agent-4B以提升性能。
Comments Work in progress
所有权危害:AI代理安全的缺失威胁模型
机构 * BlueFocus Communication Group(蓝ocus通信集团) ; Tongji University(同济大学)
专题命中 Agent评测 :agent(title,abstract);AI agent(title,abstract);分类 cs.AI、cs.CL
AI总结 本文提出Owner-Harm威胁模型,旨在解决AI代理对部署者造成伤害的问题,通过实验验证了现有防御体系的不足,并引入SSDG框架提升检测效果。
Comments 15 pages. Companion manuscript on per-decision proof-obligation synthesis (LSVJ-S) in preparation
Litmus (Re)Agent:一种用于多语言模型预测评估的基准和代理系统
机构 * Microsoft Corporation, India(微软公司(印度)) ; Mohamed bin Zayed University of Artificial Intelligence (MBZUAI)(穆罕默德·本·扎耶德人工智能大学) ; Indian Institute of Technology Hyderabad(印度理工学院海得拉巴分校)
专题命中 Agent评测 :agent(title,abstract);agentic(title,abstract);分类 cs.AI、cs.CL
AI总结 本文提出Litmus (Re)Agent代理系统,通过结构化代理推理方法,在缺乏直接证据的情况下评估多语言模型性能,尤其在转移密集场景中表现突出。
SocialJax: 多智能体强化学习中序列社会困境的评估套件
机构 * King’s College London(伦敦国王学院) ; Eindhoven University of Technology(埃因霍温理工大学) ; The Alan Turing Institute(艾伦·图灵研究所) ; Google DeepMind(谷歌DeepMind)
专题命中 Agent评测 :agent(title,abstract);multi-agent(title,abstract);分类 cs.AI、cs.LG
AI总结 本文提出SocialJax,一个用于多智能体强化学习中序列社会困境的评估套件,通过JAX实现高效环境与算法,实验显示其在实时性能上比Melting Pot RLlib快50倍,并验证了基线算法的有效性及环境的社会困境特性。
Comments Accepted at ICLR 2026
基于行为规范的AI代理定义(TDAD):从行为规范编译工具使用代理
机构 * Fiverr Labs(Fiverr 实验室)
专题命中 Agent评测 :agent(title,abstract);AI agent(title,abstract);分类 cs.AI、cs.SE
AI总结 TDAD通过编译行为规范生成可执行测试,确保工具使用代理在生产环境中的行为合规性,提升测试质量和回归安全性。
Comments 9 pages, 2 figures, open benchmark at https://github.com/f-labs-io/tdad-paper-code
打破代理骨干:评估AI代理中骨干LLM的安全性
机构 * Lakera AI ; ETH Zürich(苏黎世联邦理工学院) ; UK AI Security Institute(英国人工智能安全研究所) ; OATML, University of Oxford(OATML,牛津大学)
专题命中 Agent评测 :agent(title,abstract);AI agent(title,abstract);分类 cs.AI、cs.LG
AI总结 本文提出威胁快照框架,用于评估AI代理中LLM骨干的安全性,通过构建$b^3$基准测试揭示LLM安全性的关键影响因素。
Comments Julia Bazinska and Max Mathys contributed equally
MAS-FIRE:基于大语言模型的多智能体系统故障注入与可靠性评估
机构 * Sun Yat-sen University(中山大学)
专题命中 Agent评测 :agent(title,abstract);multi-agent(title,abstract);分类 cs.AI、cs.SE
AI总结 MAS-FIRE通过故障注入和分层分析,揭示多智能体系统在容错和鲁棒性方面的关键因素,为提升系统可靠性提供系统性方法。
双向人机协作在脑肿瘤评估中的应用提升了专家人类和AI代理的表现
专题命中 Agent评测 :agent(title,abstract);AI agent(title,abstract);分类 cs.AI、cs.LG
AI总结 双向人机协作在脑肿瘤评估中提升专家和AI性能,AI与人类协作可增强双方表现。
Comments 38 pages, 6 figures, 7 supplementary figures
AgentGuardian: 学习访问控制策略以管理AI代理行为
机构 * Faculty of Computer and Information Science(计算机与信息科学系) ; Ben Gurion University of the Negev, Israel(内盖夫本· Gurion大学)
专题命中 Agent评测 :agent(title,abstract);AI agent(title,abstract);分类 cs.AI、cs.LG
AI总结 AgentGuardian通过学习访问控制策略来管理AI代理行为,有效检测恶意输入并减少幻觉驱动的错误。
Comments 14 pages, 5 figures
权威信念:权威在多智能体评估框架中的影响
机构 * Chung-Ang University(Chung-Ang 大学)
专题命中 Agent评测 :agent(title,abstract);multi-agent(title,abstract);分类 cs.AI、cs.CL
AI总结 本文研究了权威角色在多智能体评估中的影响,发现专家和参照角色比合法角色更具影响力,并揭示了权威偏见的产生机制。
Comments Preprint
从正确性到协作:迈向以人为中心的评估AI代理行为在软件工程中的框架
机构 * Google LLC(谷歌公司)
专题命中 Agent评测 :agent(title,abstract);AI agent(title,abstract);分类 cs.AI、cs.SE
AI总结 本文提出以人为中心的评估框架,旨在评估AI代理在软件工程中的协作行为,通过定义代理行为期望和引入情境适应框架,推动AI代理向协作智能发展。
机构 * Institute of Information Engineering, Chinese Academy of Sciences, Beijing 100085, China(中国科学院信息工程研究所) ; School of Cyber Security, University of Chinese Academy of Sciences, Beijing 100049, China(中国科学院大学网络安全学院)
专题命中 Agent评测 :agent(title,abstract);multi-agent(title,abstract);分类 cs.AI、cs.CL
Comments The article has been accepted by Frontiers of Computer Science (FCS), with the DOI: {10.1007/s11704-025-51369-x}
专题命中 Agent评测 :agent(title,abstract);multi-agent(title,abstract);分类 cs.AI、cs.LG
Comments Preprint (submitted version) to be presented at the 13th International Conference on Industrial Engineering and Applications (ICIEA-EU), Milan, 2026. The final Version of Record will appear in the official conference proceedings
机构 * Institute of Artificial Intelligence (TeleAI), China Telecom(人工智能研究院(TeleAI),中国电信) ; School of Computer Science, Shanghai Jiao Tong University(上海交通大学计算机科学学院) ; University of Science and Technology of China(中国科学技术大学) ; GigaAI ; School of Computer Science and Technology, Xinjiang University(新疆大学计算机科学与技术学院)
专题命中 Agent评测 :agent(title,abstract);multi-agent(title,abstract);分类 cs.AI、cs.LG
专题命中 Agent评测 :agent(title,abstract);AI agent(title,abstract);分类 cs.AI、cs.CL
机构 * Institute of High Performance Computing, Agency for Science, Technology and Research (A*STAR)(高性能计算研究所,科技研究局(A*STAR)) ; Centre for Innovation and Precision Eye Health(创新与精准眼健康中心) ; Department of Ophthalmology, NUHS Tower Block, Level 7, 1E Kent Ridge Road, Singapore, 119228(眼科部,NUHS塔楼7层,1E Kent Ridge Road,新加坡,119228) ; Singapore Eye Research Institute, Singapore National Eye Centre, 20 College Road, Singapore, 169856(新加坡眼研究 institute,新加坡国家眼科中心,20 College Road,新加坡,169856)
专题命中 Agent评测 :agent(title,abstract);workflow(title);multi-agent(abstract);分类 cs.AI、cs.CL
Comments 9 figures, 5 tables. submit/6621751