arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

AI Agent

智能体、工具调用、规划、工作流、多智能体和自主任务执行。

共收录 15729 信号源:cs.AI, cs.CL, cs.LG, cs.SE

1. Agent评测 15729 篇

2505.15372 2025-05-22 cs.CL 85%

X-WebAgentBench: A Multilingual Interactive Web Benchmark for Evaluating Global Agentic System

Peng Wang, Ruihan Tao, Qiguang Chen, Mengkang Hu, Libo Qin

专题命中 Agent评测 :agentic(title,abstract);agent(abstract);planning(abstract);分类 cs.CL

Comments Accepted by ACL 2025 Findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.13504 2025-05-21 cs.IR cs.AI cs.MA 85%

An agentic system with reinforcement-learned subsystem improvements for parsing form-like documents

Ayesha Amjad, Saurav Sthapit, Tahir Qasim Syed

机构 * Institute of Business Administration Karachi, Pakistan(巴基斯坦卡利亚克大学商学院) Coventry University(科文特大学)

专题命中 Agent评测 :agentic(title,abstract);agent(abstract);multi-agent(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.01560 2025-05-06 cs.CL 85%

AI agents may be worth the hype but not the resources (yet): An initial exploration of machine translation quality and costs in three language pairs in the legal and news domains

Vicent Briva Iglesias, Gokhan Dogru

专题命中 Agent评测 :AI agent(title);agent(abstract);agentic(abstract);multi-agent(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.19519 2025-03-10 cs.HC cs.AI 85%

Static Vs. Agentic Game Master AI for Facilitating Solo Role-Playing Experiences

Nicolai Hejlesen Jørgensen, Sarmilan Tharmabalan, Ilhan Aslan, Nicolai Brodersen Hansen, Timothy Merritt

专题命中 Agent评测 :agentic(title,abstract);agent(abstract);multi-agent(abstract);分类 cs.AI

Comments 17 pages, 10 figures, 1 table, submitted for review

详情

展开后加载摘要…

URL PDF HTML 收藏
2409.03793 2025-03-04 cs.CR cs.AI 85%

Safeguarding AI Agents: Developing and Analyzing Safety Architectures

Ishaan Domkundwar, Mukunda N S, Ishaan Bhola, Riddhik Kochhar

专题命中 Agent评测 :AI agent(title,abstract);agent(abstract);agentic(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2403.08251 2024-09-02 cs.MA cs.AI cs.CY 85%

Emergence of Social Norms in Generative Agent Societies: Principles and Architecture

Siyue Ren, Zhiyao Cui, Ruiqi Song, Zhen Wang, Shuyue Hu

专题命中 Agent评测 :agent(title,abstract);planning(abstract);multi-agent(abstract);分类 cs.AI

Comments Published as a conference paper at IJCAI 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2407.18961 2024-08-19 cs.AI 85%

MMAU: A Holistic Benchmark of Agent Capabilities Across Diverse Domains

Guoli Yin, Haoping Bai, Shuang Ma, Feng Nan, Yanchao Sun, Zhaoyang Xu, Shen Ma, Jiarui Lu, Xiang Kong, Aonan Zhang, Dian Ang Yap, Yizhe zhang, Karsten Ahnert, Vik Kamath, Mathias Berglund, Dominic Walsh, Tobias Gindele, Juergen Wiest, Zhengfeng Lai, Xiaoming Wang, Jiulong Shan, Meng Cao, Ruoming Pang, Zirui Wang

专题命中 Agent评测 :agent(title,abstract);tool-use(abstract);planning(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2010.00993 2021-09-16 cs.RO cs.LG cs.MA 85%

MADRaS : Multi Agent Driving Simulator

Anirban Santara, Sohan Rudra, Sree Aditya Buridi, Meha Kaushik, Abhishek Naik, Bharat Kaul, Balaraman Ravindran

专题命中 Agent评测 :agent(title,abstract);planning(abstract);multi-agent(abstract);分类 cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
1805.05230 2018-05-15 cs.AI cs.MA 85%

Maximizing Expected Impact in an Agent Reputation Network -- Technical Report

Gavin Rens, Abhaya Nayak, Thomas Meyer

专题命中 Agent评测 :agent(title,abstract);planning(abstract);multi-agent(abstract);分类 cs.AI

Comments 18 pages including bibliography

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.16345 2026-07-22 cs.SE cs.AI cs.LG cs.PF 版本更新 85%

AEVAL: From Anecdotal to Deterministic Testing for Agentic Skill Workflows

AEVAL:从轶事性到确定性的智能体技能工作流测试

Tejas Singh Anand, Yuet Ying Christina Wang, Wanting Jiang, Steve Masson, Tian Zheng, Bingjie Zhou

机构 * nvidia(NVIDIA公司)

专题命中 Agent评测 :agentic(title,abstract);agent(abstract);分类 cs.AI、cs.LG、cs.SE

AI总结 研究针对智能体技能工作流测试缺乏确定性和可重复性的问题,提出AEVAL框架,通过执行器与评分器分离等方法,实现确定性、可重复的测试,给出分层修复建议,能将虚假通过率转换为可重复失败信号并记录修复过程。

Comments 8 pages, 1 figure, 1 table, accepted at the ICML 2026 Workshop on Statistical Frameworks for Uncertainty in Agentic Systems

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.13104 2026-07-16 cs.AI cs.CL cs.LG 新提交 85%

Self-Improvements in Modern Agentic Systems: A Survey

现代智能系统中的自我改进:一项综述

Zhe Ren, Yimeng Chen, Dandan Guo, Guowei Rong, Tonghui Li, R. B. Xiong, Qingfeng Lan, Wenyi Wang, Li Nanbo, Yibo Yang, Mingchen Zhuge, Jürgen Schmidhuber

机构 * School of Artificial Intelligence, Jilin University(吉林大学人工智能学院) King Abdullah University of Science and Technology (KAUST)(阿卜杜拉国王科技大学) University of Alberta(阿尔伯塔大学) The Swiss AI Lab IDSIA/USI/SUPSI(瑞士人工智能实验室IDSIA/USI/SUPSI)

专题命中 Agent评测 :agentic(title);agent(abstract,comments);autonomous agent(abstract);分类 cs.AI、cs.CL、cs.LG

AI总结 综述现代自我改进智能体从研究走向部署,目标是经验驱动的可控进化。提出系统级框架,将智能体视为基础模型与操作支架的耦合配置,自我改进形式化为更新算子,还组织回顾了相关工作、应用、评估等内容并展望未来。

Comments 97 pages, 12 figures. Project page: https://selfimproving-agent.github.io/ Repository: https://github.com/selfimproving-agent/awesome-Self-Improving-Agents

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.15760 2026-05-26 cs.CL cs.AI 85%

LiveMCP-101: Stress Testing and Diagnosing MCP-enabled Agents on Challenging Queries

LiveMCP-101:对支持MCP的智能体进行压力测试与诊断

Ming Yin, Dinghan Shen, Silei Xu, Sixun Dong, Mian Zhang, Yebowen Hu, Shujian Liu, Jianbing Han, Simin Ma, Song Wang, Sathish Reddy Indurthi, Xun Wang, Yiran Chen, Kaiqiang Song

机构 * Duke University(杜克大学)

专题命中 Agent评测 :agent(abstract);AI agent(abstract);autonomous agent(abstract);tool use(abstract)

AI总结 针对MCP工具在动态多步任务中的评估空白,提出LiveMCP-101基准测试(101个真实查询),通过并行评估框架发现前沿LLM成功率低于60%,并识别出七种失败模式。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.01712 2026-05-21 cs.AI cs.LG 85%

FT-Dojo: Towards Autonomous LLM Fine-Tuning with Language Agents

FT-Dojo: 向自主LLM微调迈进的语言代理

Qizheng Li, Yifei Zhang, Xiao Yang, Xu Yang, Zhuo Wang, Weiqing Liu, Jiang Bian

机构 * Peking University(北京大学) Nanjing University(南京大学) Microsoft Research Asia(微软亚洲研究院) The University of Chicago(芝加哥大学)

专题命中 Agent评测 :agent(summary_cn,abstract);planning(abstract);分类 cs.AI、cs.LG

AI总结 本文提出FT-Dojo交互式基准环境,用于研究自主LLM微调,通过标准化任务接口、共享数据仓库、沙盒执行环境和反馈协议,开发了FT-Agent框架,实现了结构化迭代规划和多级反馈分析,实验显示FT-Agent在13个任务中表现优异,且展示了代理在故障恢复和长期规划中的能力。

Comments 26 pages, 6 figures, 11 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.13173 2026-03-17 cs.AI cs.CL 85%

Semantic Invariance in Agentic AI

代理AI中的语义不变性

I. de Zarzà, J. de Curtò, Jordi Cabot, Pietro Manzoni, Carlos T. Calafate

专题命中 Agent评测 :agentic(title);agent(abstract,comments);multi-agent(abstract,comments);分类 cs.AI、cs.CL

AI总结 本文提出一种元测试框架,评估大语言模型代理在语义等效输入变化下的推理稳定性,发现模型规模与鲁棒性无正相关,较小的Qwen3-30B-A3B表现出最高稳定性。

Comments Accepted for publication in 20th International Conference on Agents and Multi-Agent Systems: Technologies and Applications (AMSTA 2026), to appear in Springer Nature proceedings (KES Smart Innovation Systems and Technologies). The final authenticated version will be available online at Springer

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.20666 2025-07-29 eess.AS cs.AI cs.LG cs.SD 85%

MIMII-Agent: Leveraging LLMs with Function Calling for Relative Evaluation of Anomalous Sound Detection

Harsh Purohit, Tomoya Nishida, Kota Dohi, Takashi Endo, Yohei Kawaguchi

机构 * Hitachi Ltd., R\&D Group, Tokyo, Japan

专题命中 Agent评测 :agent(title);function calling(title);分类 cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.16203 2025-07-23 cs.CR cs.AI cs.AR cs.LG 85%

SVAgent: AI Agent for Hardware Security Verification Assertion

Rui Guo, Avinash Ayalasomayajula, Henian Li, Jingbo Zhou, Sujan Kumar Saha, Farimah Farahmandi

机构 * Department of Electrical and Computer Engineering, University of Florida(电子与计算机工程系,佛罗里达大学)

专题命中 Agent评测 :agent(title);AI agent(title);分类 cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.12855 2024-10-21 cs.CL cs.AI 85%

JAILJUDGE: A Comprehensive Jailbreak Judge Benchmark with Multi-Agent Enhanced Explanation Evaluation Framework

Fan Liu, Yue Feng, Zhao Xu, Lixin Su, Xinyu Ma, Dawei Yin, Hao Liu

专题命中 Agent评测 :agent(title);multi-agent(title);分类 cs.AI、cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2101.10430 2022-01-21 eess.SY cs.AI cs.SE cs.SY 85%

Test and Evaluation Framework for Multi-Agent Systems of Autonomous Intelligent Agents

Erin Lanus, Ivan Hernandez, Adam Dachowicz, Laura Freeman, Melanie Grande, Andrew Lang, Jitesh H. Panchal, Anthony Patrick, Scott Welch

专题命中 Agent评测 :agent(title);multi-agent(title);分类 cs.AI、cs.SE

详情

展开后加载摘要…

URL PDF HTML 收藏
2201.13448 2024-05-10 cs.HC cs.CY cs.LG 85%

Warmth and competence in human-agent cooperation

Kevin R. McKee, Xuechunzi Bai, Susan T. Fiske

专题命中 Agent评测 :agent(title,abstract);AI agent(abstract);分类 cs.LG;autonomous agent(comments)

Comments Accepted at Autonomous Agents and Multi-Agent Systems

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.19202 2026-08-21 cs.AI cs.CL cs.LG 新提交 85%

Active Inference as Context Acquisition for AI Agents

主动推理作为AI智能体的上下文获取机制

Sanchayan Dutta, Sai Niranjan Ramachandran, Suvrit Sra

机构 * University of California, Davis(加利福尼亚大学戴维斯分校) Technical University of Munich(慕尼黑工业大学)

专题命中 Agent评测 :AI agent(title,abstract);agent(abstract);分类 cs.AI、cs.CL、cs.LG

AI总结 该研究将AI智能体的上下文获取权衡形式化为主动推理,在最优提问框架中验证其有效性,为智能体上下文获取层提供模型无关的设计原则。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.13522 2026-08-14 cs.LG cs.AI cs.LO cs.PL cs.SE 新提交 85%

Vero: Can AI Agents Build Formally Verified Software Repositories?

Vero:AI智能体能否构建形式化验证的软件仓库?

Zhe Ye, Hantao Lou, Yuechun Sun, Peiyang Song, Zhengxu Yan, Timothe Kasriel, Qingyang Zhang, Kaiyu Yang, Soonho Kong, Jingxuan He, Dawn Song

机构 * University of Chicago(芝加哥大学) California Institute of Technology(加州理工学院) Stanford University(斯坦福大学) UC Berkeley(加州大学伯克利分校) Amazon Web Services(亚马逊云计算服务) Apodex

专题命中 Agent评测 :AI agent(title,abstract);agent(abstract);分类 cs.AI、cs.LG、cs.SE

AI总结 研究推出首个仓库级验证软件综合基准Vero,含43个多模块实例,评估发现前沿智能体仅解决27个实例,为相关研究提供测试平台。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.01042 2026-08-04 cs.SE cs.AI cs.HC cs.LG 新提交 85%

What Could the Agent See at 19:05? Generating Temporal Enterprise Scenarios from Real Research and Replaying Them to Evaluate Agents

智能体在19:05能看到什么?从真实研究生成时间化企业场景并回放以评估智能体

Tezan Sahu, Himani Arora

专题命中 Agent评测 :agent(title,abstract);AI agent(abstract);分类 cs.AI、cs.LG、cs.SE

AI总结 本研究提出从真实研究生成时间化企业场景并回放的系统,用于解决现有离线评估智能体仅基于最终静态快照的问题,可在任意时刻评估可插拔智能体。

Comments 6 pages, 3 figures, 4 tables. Accepted as a poster at SERI 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.01527 2026-07-30 cs.SE cs.AI cs.LG 版本更新 85%

REAP: Automatic Curation of Coding Agent Benchmarks from Interactive Production Usage

REAP:从交互生产使用自动整理编码代理基准

Smriti Jha, Matteo Paltenghi, Chandra Maddila, Vijayaraghavan Murali, Shubham Ugare, Satish Chandra

机构 * Meta, USA(Meta公司)

专题命中 Agent评测 :agent(title,abstract);agentic(abstract);分类 cs.AI、cs.LG、cs.SE

AI总结 REAP通过自动化流程从真实开发者与代理交互中构建生产基准,解决评估信号不可靠问题,通过LLM分类和多轮稳定性检查确保基准可信。

Comments Accepted at ASE 2026 Industry Showcase

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.25828 2026-07-29 cs.NI 新提交 85%

C-RE-ACT: Causal RE-ACTing Agent for O-RAN Forensic Triage

C-RE-ACT:用于O-RAN取证分类的因果反应代理

Pau Baguer, J. Xavier Salvat Lozano, Gines Garcia-Aviles, Xavier Costa-Pérez

专题命中 Agent评测 :agent(title,abstract);autonomous agent(abstract);agentic(abstract)

AI总结 研究O-RAN架构下性能降级攻击难区分问题,提出C-RE-ACT框架,用结构不可知模型构建加权有向无环图,经图同构网络编码,在测试平台评估,能准确分离根本原因,提升LLM准确率及代理异常分类准确率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.10397 2026-07-28 cs.IR 版本更新 85%

RecoWorld: Building Simulated Environments for Agentic Recommender Systems

RecoWorld:为代理推荐系统构建模拟环境

Fei Liu, Xinyu Lin, Hanchao Yu, Mingyuan Wu, Jianyu Wang, Qiang Zhang, Zhuokai Zhao, Yinglong Xia, Yao Zhang, Weiwei Li, Mingze Gao, Qifan Wang, Lizhu Zhang, Benyu Zhang, Xiangjun Fan

专题命中 Agent评测 :agentic(title,abstract);agent(abstract);multi-agent(abstract)

AI总结 RecoWorld通过双视角架构和多轮强化学习,构建了代理推荐系统的模拟环境,旨在提升用户留存和参与度。

Comments HCRS @ WWW 2026, Best Paper Award

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.21824 2026-07-27 cs.CR 新提交 85%

Protocol-Level Attacks on Agentic Commerce Platforms: A Cross-Platform Taxonomy, AIP-Bench, and Unified Defense

对智能商务平台的协议级攻击:跨平台分类法、AIP基准和统一防御

Yedidel Louck

专题命中 Agent评测 :agentic(title,abstract);agent(abstract);AI agent(abstract)

AI总结 研究智能商务平台协议层安全问题,识别出33个结构性漏洞。贡献分类法,构建AIP-Bench基准和PCAT防御机制,将部分结构类攻击成功率降至零,强调协议层安全防护的重要性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.21019 2026-07-24 cs.AI cs.CL cs.HC cs.MA cs.SE 新提交 85%

HiMe: Real-Time Self-Hosted Personal Agent Platform for Health Insights with Wearable Devices

HiMe:用于健康洞察的实时自托管个人代理平台与可穿戴设备

Wei Liu, Siya Qi, Linhai Zhang, Lorainne Tudor Car, Yulan He

机构 * King’s College London(伦敦国王学院) The Alan Turing Institute(艾伦·图灵研究所)

专题命中 Agent评测 :agent(title,abstract);agentic(abstract);分类 cs.AI、cs.CL、cs.SE

AI总结 针对传统可穿戴健康信号分析的局限,HiMe提出本地可部署、隐私至上的代理平台,遵循数据库为一等组件等原则,能与多种可穿戴设备实时健康数据生态系统兼容,实现个人持续、个性化健康监测以提升幸福感。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.02124 2026-07-23 cs.NI cs.ET 版本更新 85%

FlexNGIA 2.0: Redesigning the Internet with Agentic AI -- Protocols, Services, and Traffic Engineering Designed, Deployed, and Managed by AI

FlexNGIA 2.0:利用智能AI重新设计互联网——由AI设计、部署和管理的协议、服务和流量工程

Mohamed Faten Zhani, Younes Korbi, Yamen Mkadem

专题命中 Agent评测 :agentic(title,abstract);agent(abstract);AI agent(abstract)

AI总结 面对沉浸式通信需求等带来的契机,FlexNGIA 2.0利用基于大语言模型的AI智能体自主编排、配置和演进网络,可动态调整多种网络方案。通过初步实验证明其能力,为新型智能AI驱动网络奠基,也指出了相关关键研究挑战。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.17799 2026-07-21 cs.SE cs.AI cs.CL 版本更新 85%

Position: Coding Benchmarks Are Misaligned with Agentic Software Engineering

立场:编程基准与智能体软件工程不一致

Maria I. Gorinova, Macey Baker, Amy Heineike, Maksim Shaposhnikov, Rob Willoughby, Dru Knox

机构 * Tessl

专题命中 Agent评测 :agentic(title,abstract);agent(abstract);分类 cs.AI、cs.CL、cs.SE

AI总结 本文指出当前编程基准在智能体时代存在三大问题:混淆模型与系统框架、单一参考答案惩罚有效替代方案、缺乏组件级信号导致迭代困难,并提出应重新设计基准以对齐智能体软件工程。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.03601 2026-07-07 cs.AR 新提交 85%

ArchEval: Measuring AI Agents as Computer Architects

ArchEval:将人工智能代理作为计算机架构师进行评估

Chenyu Wang, Zishen Wan, Jeffrey Ma, Shvetank Prakash, Zhenting Qi, Haebin Do, Andy Cheng, Arya Tschand, Jiahe Shi, Yilun Du, Vijay Janapa Reddi

专题命中 Agent评测 :AI agent(title);agent(abstract);tool use(abstract);workflow(abstract)

AI总结 介绍用于评估大语言模型代理在计算机架构设计与优化方面的ArchEval基准和平台,含20个挑战及8个模拟器,通过不同设置运行,报告性能并记录轨迹,揭示当前代理的优缺点及后续所需能力。

详情

展开后加载摘要…

URL PDF HTML 收藏