X-WebAgentBench: A Multilingual Interactive Web Benchmark for Evaluating Global Agentic System
专题命中 Agent评测 :agentic(title,abstract);agent(abstract);planning(abstract);分类 cs.CL
Comments Accepted by ACL 2025 Findings
AI 大模型
智能体、工具调用、规划、工作流、多智能体和自主任务执行。
专题命中 Agent评测 :agentic(title,abstract);agent(abstract);planning(abstract);分类 cs.CL
Comments Accepted by ACL 2025 Findings
机构 * Institute of Business Administration Karachi, Pakistan(巴基斯坦卡利亚克大学商学院) ; Coventry University(科文特大学)
专题命中 Agent评测 :agentic(title,abstract);agent(abstract);multi-agent(abstract);分类 cs.AI
专题命中 Agent评测 :AI agent(title);agent(abstract);agentic(abstract);multi-agent(abstract)
专题命中 Agent评测 :agentic(title,abstract);agent(abstract);multi-agent(abstract);分类 cs.AI
Comments 17 pages, 10 figures, 1 table, submitted for review
专题命中 Agent评测 :AI agent(title,abstract);agent(abstract);agentic(abstract);分类 cs.AI
专题命中 Agent评测 :agent(title,abstract);planning(abstract);multi-agent(abstract);分类 cs.AI
Comments Published as a conference paper at IJCAI 2024
专题命中 Agent评测 :agent(title,abstract);tool-use(abstract);planning(abstract);分类 cs.AI
专题命中 Agent评测 :agent(title,abstract);planning(abstract);multi-agent(abstract);分类 cs.LG
专题命中 Agent评测 :agent(title,abstract);planning(abstract);multi-agent(abstract);分类 cs.AI
Comments 18 pages including bibliography
AEVAL:从轶事性到确定性的智能体技能工作流测试
机构 * nvidia(NVIDIA公司)
专题命中 Agent评测 :agentic(title,abstract);agent(abstract);分类 cs.AI、cs.LG、cs.SE
AI总结 研究针对智能体技能工作流测试缺乏确定性和可重复性的问题,提出AEVAL框架,通过执行器与评分器分离等方法,实现确定性、可重复的测试,给出分层修复建议,能将虚假通过率转换为可重复失败信号并记录修复过程。
Comments 8 pages, 1 figure, 1 table, accepted at the ICML 2026 Workshop on Statistical Frameworks for Uncertainty in Agentic Systems
现代智能系统中的自我改进:一项综述
机构 * School of Artificial Intelligence, Jilin University(吉林大学人工智能学院) ; King Abdullah University of Science and Technology (KAUST)(阿卜杜拉国王科技大学) ; University of Alberta(阿尔伯塔大学) ; The Swiss AI Lab IDSIA/USI/SUPSI(瑞士人工智能实验室IDSIA/USI/SUPSI)
专题命中 Agent评测 :agentic(title);agent(abstract,comments);autonomous agent(abstract);分类 cs.AI、cs.CL、cs.LG
AI总结 综述现代自我改进智能体从研究走向部署,目标是经验驱动的可控进化。提出系统级框架,将智能体视为基础模型与操作支架的耦合配置,自我改进形式化为更新算子,还组织回顾了相关工作、应用、评估等内容并展望未来。
Comments 97 pages, 12 figures. Project page: https://selfimproving-agent.github.io/ Repository: https://github.com/selfimproving-agent/awesome-Self-Improving-Agents
LiveMCP-101:对支持MCP的智能体进行压力测试与诊断
机构 * Duke University(杜克大学)
专题命中 Agent评测 :agent(abstract);AI agent(abstract);autonomous agent(abstract);tool use(abstract)
AI总结 针对MCP工具在动态多步任务中的评估空白,提出LiveMCP-101基准测试(101个真实查询),通过并行评估框架发现前沿LLM成功率低于60%,并识别出七种失败模式。
FT-Dojo: 向自主LLM微调迈进的语言代理
机构 * Peking University(北京大学) ; Nanjing University(南京大学) ; Microsoft Research Asia(微软亚洲研究院) ; The University of Chicago(芝加哥大学)
专题命中 Agent评测 :agent(summary_cn,abstract);planning(abstract);分类 cs.AI、cs.LG
AI总结 本文提出FT-Dojo交互式基准环境,用于研究自主LLM微调,通过标准化任务接口、共享数据仓库、沙盒执行环境和反馈协议,开发了FT-Agent框架,实现了结构化迭代规划和多级反馈分析,实验显示FT-Agent在13个任务中表现优异,且展示了代理在故障恢复和长期规划中的能力。
Comments 26 pages, 6 figures, 11 tables
代理AI中的语义不变性
专题命中 Agent评测 :agentic(title);agent(abstract,comments);multi-agent(abstract,comments);分类 cs.AI、cs.CL
AI总结 本文提出一种元测试框架,评估大语言模型代理在语义等效输入变化下的推理稳定性,发现模型规模与鲁棒性无正相关,较小的Qwen3-30B-A3B表现出最高稳定性。
Comments Accepted for publication in 20th International Conference on Agents and Multi-Agent Systems: Technologies and Applications (AMSTA 2026), to appear in Springer Nature proceedings (KES Smart Innovation Systems and Technologies). The final authenticated version will be available online at Springer
机构 * Hitachi Ltd., R\&D Group, Tokyo, Japan
专题命中 Agent评测 :agent(title);function calling(title);分类 cs.AI、cs.LG
机构 * Department of Electrical and Computer Engineering, University of Florida(电子与计算机工程系,佛罗里达大学)
专题命中 Agent评测 :agent(title);AI agent(title);分类 cs.AI、cs.LG
专题命中 Agent评测 :agent(title);multi-agent(title);分类 cs.AI、cs.CL
专题命中 Agent评测 :agent(title);multi-agent(title);分类 cs.AI、cs.SE
专题命中 Agent评测 :agent(title,abstract);AI agent(abstract);分类 cs.LG;autonomous agent(comments)
Comments Accepted at Autonomous Agents and Multi-Agent Systems
主动推理作为AI智能体的上下文获取机制
机构 * University of California, Davis(加利福尼亚大学戴维斯分校) ; Technical University of Munich(慕尼黑工业大学)
专题命中 Agent评测 :AI agent(title,abstract);agent(abstract);分类 cs.AI、cs.CL、cs.LG
AI总结 该研究将AI智能体的上下文获取权衡形式化为主动推理,在最优提问框架中验证其有效性,为智能体上下文获取层提供模型无关的设计原则。
Vero:AI智能体能否构建形式化验证的软件仓库?
机构 * University of Chicago(芝加哥大学) ; California Institute of Technology(加州理工学院) ; Stanford University(斯坦福大学) ; UC Berkeley(加州大学伯克利分校) ; Amazon Web Services(亚马逊云计算服务) ; Apodex
专题命中 Agent评测 :AI agent(title,abstract);agent(abstract);分类 cs.AI、cs.LG、cs.SE
AI总结 研究推出首个仓库级验证软件综合基准Vero,含43个多模块实例,评估发现前沿智能体仅解决27个实例,为相关研究提供测试平台。
智能体在19:05能看到什么?从真实研究生成时间化企业场景并回放以评估智能体
专题命中 Agent评测 :agent(title,abstract);AI agent(abstract);分类 cs.AI、cs.LG、cs.SE
AI总结 本研究提出从真实研究生成时间化企业场景并回放的系统,用于解决现有离线评估智能体仅基于最终静态快照的问题,可在任意时刻评估可插拔智能体。
Comments 6 pages, 3 figures, 4 tables. Accepted as a poster at SERI 2026
REAP:从交互生产使用自动整理编码代理基准
机构 * Meta, USA(Meta公司)
专题命中 Agent评测 :agent(title,abstract);agentic(abstract);分类 cs.AI、cs.LG、cs.SE
AI总结 REAP通过自动化流程从真实开发者与代理交互中构建生产基准,解决评估信号不可靠问题,通过LLM分类和多轮稳定性检查确保基准可信。
Comments Accepted at ASE 2026 Industry Showcase
C-RE-ACT:用于O-RAN取证分类的因果反应代理
专题命中 Agent评测 :agent(title,abstract);autonomous agent(abstract);agentic(abstract)
AI总结 研究O-RAN架构下性能降级攻击难区分问题,提出C-RE-ACT框架,用结构不可知模型构建加权有向无环图,经图同构网络编码,在测试平台评估,能准确分离根本原因,提升LLM准确率及代理异常分类准确率。
RecoWorld:为代理推荐系统构建模拟环境
专题命中 Agent评测 :agentic(title,abstract);agent(abstract);multi-agent(abstract)
AI总结 RecoWorld通过双视角架构和多轮强化学习,构建了代理推荐系统的模拟环境,旨在提升用户留存和参与度。
Comments HCRS @ WWW 2026, Best Paper Award
对智能商务平台的协议级攻击:跨平台分类法、AIP基准和统一防御
专题命中 Agent评测 :agentic(title,abstract);agent(abstract);AI agent(abstract)
AI总结 研究智能商务平台协议层安全问题,识别出33个结构性漏洞。贡献分类法,构建AIP-Bench基准和PCAT防御机制,将部分结构类攻击成功率降至零,强调协议层安全防护的重要性。
HiMe:用于健康洞察的实时自托管个人代理平台与可穿戴设备
机构 * King’s College London(伦敦国王学院) ; The Alan Turing Institute(艾伦·图灵研究所)
专题命中 Agent评测 :agent(title,abstract);agentic(abstract);分类 cs.AI、cs.CL、cs.SE
AI总结 针对传统可穿戴健康信号分析的局限,HiMe提出本地可部署、隐私至上的代理平台,遵循数据库为一等组件等原则,能与多种可穿戴设备实时健康数据生态系统兼容,实现个人持续、个性化健康监测以提升幸福感。
FlexNGIA 2.0:利用智能AI重新设计互联网——由AI设计、部署和管理的协议、服务和流量工程
专题命中 Agent评测 :agentic(title,abstract);agent(abstract);AI agent(abstract)
AI总结 面对沉浸式通信需求等带来的契机,FlexNGIA 2.0利用基于大语言模型的AI智能体自主编排、配置和演进网络,可动态调整多种网络方案。通过初步实验证明其能力,为新型智能AI驱动网络奠基,也指出了相关关键研究挑战。
立场:编程基准与智能体软件工程不一致
机构 * Tessl
专题命中 Agent评测 :agentic(title,abstract);agent(abstract);分类 cs.AI、cs.CL、cs.SE
AI总结 本文指出当前编程基准在智能体时代存在三大问题:混淆模型与系统框架、单一参考答案惩罚有效替代方案、缺乏组件级信号导致迭代困难,并提出应重新设计基准以对齐智能体软件工程。
ArchEval:将人工智能代理作为计算机架构师进行评估
专题命中 Agent评测 :AI agent(title);agent(abstract);tool use(abstract);workflow(abstract)
AI总结 介绍用于评估大语言模型代理在计算机架构设计与优化方面的ArchEval基准和平台,含20个挑战及8个模拟器,通过不同设置运行,报告性能并记录轨迹,揭示当前代理的优缺点及后续所需能力。