arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

AI Agent

智能体、工具调用、规划、工作流、多智能体和自主任务执行。

共收录 15729 信号源:cs.AI, cs.CL, cs.LG, cs.SE

1. Agent评测 15729 篇

2606.12128 2026-06-11 cs.CE 新提交 88%

From Agent Identity to Agent Economy: Measuring the Operational Readiness of ERC-8004 AI Agents

从代理身份到代理经济:衡量ERC-8004 AI代理的操作就绪度

Rischan Mafrur, Priagung Khusumanegara

专题命中 Agent评测 :agent(title,abstract);AI agent(title,abstract)

AI总结 本文通过分析以太坊上ERC-8004代理的数据,构建操作就绪度框架,发现早期采用以注册为主但操作浅层,身份层可见但元数据、服务、声誉和跨链证据有限,所有权和反馈活动高度集中,表明从代理身份到代理经济的转型尚未完成。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.19961 2026-06-08 eess.SY cs.SY 版本更新 88%

Toward Trustworthy Digital Twins in AI Agent-based Wireless Network Optimization: Challenges, Solutions, and Opportunities

迈向可信的AI代理无线网络优化数字孪生:挑战、解决方案与机遇

Zhenyu Tao, Wei Xu, Xiaohu You

专题命中 Agent评测 :agent(title,abstract);AI agent(title,abstract)

AI总结 本文提出一种新的数字孪生评估框架,用于确保AI代理基于网络优化的数字孪生的可信度,通过任务导向的评估方法减少训练和测试成本,同时保持部署性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.00829 2026-06-02 cs.CL cs.AI cs.LG 88%

Constitutional Black-Box Monitoring for Scheming in LLM Agents

LLM Agent 中阴谋行为的宪法黑盒监控

Simon Storf, Rich Barton-Cooper, James Peters-Gill, Marius Hobbhahn

机构 * University of Cambridge(剑桥大学)

专题命中 Agent评测 :agent(title_cn,summary_cn);分类 cs.AI、cs.CL、cs.LG

AI总结 研究使用基于宪法黑盒的监控器,通过仅观察外部输入和输出检测LLM Agent的阴谋行为,并在合成数据上优化后泛化到更真实环境。

Comments Accepted at ICML 2026. Camera-ready version

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.12934 2026-05-14 cs.CY 88%

An Activity-Theoretical Approach to Teacher Professional Development in Pedagogical AI Agent Design

基于活动理论的教师专业发展在教学人工智能代理设计中的应用

Haiyang Xin, Qiannan Niu, Shuang Li, Yimeng Sun, Ching Sing Chai, Lingyun Huang, Gaowei Chen

专题命中 Agent评测 :agent(title,abstract);AI agent(title,abstract)

AI总结 本研究通过两轮形成性干预,探讨教师在完成专业发展后为何失去创建AI代理的兴趣,并验证系统性设计能否解决这一问题,发现通过活动理论和自我决定理论的整合,可提升教师的能力与意愿。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.29727 2026-04-02 q-bio.BM 88%

Latent-Y: A Lab-Validated Autonomous Agent for De Novo Drug Design

Latent-Y:一种经过实验室验证的自主代理用于从头药物设计

Latent Labs Team, Sebastian M. Schmon, Daniella Pretorius, Simon Mathis, Rebecca Bartke-Croughan, Aishaini Puvanendran, James Vuckovic, Henry Kenlay, Mária Vlachynská, Alex Bridgland, Ivan Grishin, Sven Over, David Li, Bridget Li, Jonathan Crabbé, Agrin Hilmkil, Alexander W. R. Nelson, David Yuan, Annette Obika, Simon A. A. Kohl

专题命中 Agent评测 :agent(title,abstract);autonomous agent(title);AI agent(abstract)

AI总结 Latent-Y通过自主执行抗体设计流程,结合生成模型Latent-X2,实现了高效药物设计,展示了在不同任务类型中的成功案例,并在实验室验证中达到高成功率。

Comments A.N. performed work as an advisor to Latent Labs. A.H. and D.Y. performed work while at Latent Labs

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.08835 2026-03-11 cs.AI cs.CL cs.LG 88%

MASEval: Extending Multi-Agent Evaluation from Models to Systems

MASEval: 从模型到系统的多智能体评估扩展

Cornelius Emde, Alexander Rubinstein, Anmol Goel, Ahmed Heakl, Sangdoo Yun, Seong Joon Oh, Martin Gubri

机构 * Parameter Lab(参数实验室) University of Oxford(牛津大学) University of Tübingen(图宾根大学) TU Darmstadt(德累斯顿理工大学) MBZUAI NAVER AI Lab(NAVER AI实验室) KAIST(韩国科学技术院)

专题命中 Agent评测 :agent(title);multi-agent(title);agentic(abstract);分类 cs.AI、cs.CL、cs.LG

AI总结 MASEval通过系统层面的比较揭示框架选择与模型选择同等重要,为智能体系统设计提供新途径。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.13999 2026-02-17 cs.RO 88%

It Takes Two to Tango: A Holistic Simulator for Joint Order Scheduling and Multi-Agent Path Finding in Robotic Warehouses

双人探戈也需要两人:一种综合模拟器用于机器人仓库中的联合订单调度和多智能体路径寻找

Haozheng Xu, Wenhao Li, Zifan Wei, Bo Jin, Hongxing Bai, Ben Yang, Xiangfeng Wang

机构 * East China Normal University(东华大学) Tongji University(同济大学) Zhejiang Galaxis Technology Group Co.,Ltd(浙江伽利西科技集团有限公司) Shenzhen Loop Area Institute (SLAI)(深圳环 area 研究院)

专题命中 Agent评测 :agent(title,abstract);multi-agent(title,abstract)

AI总结 WareRover是一种综合模拟器,通过闭环优化接口紧密耦合订单调度与多智能体路径寻找,为机器人仓库的鲁棒协调提供挑战性测试环境。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.09139 2026-02-02 cs.CV 88%

MACEval: A Multi-Agent Continual Evaluation Network for Large Models

MACEval: 一种用于大型模型的多智能体持续评估网络

Zijian Chen, Yuze Sun, Yuan Tian, Wenjun Zhang, Guangtao Zhai

机构 * Shanghai Jiao Tong University, Shanghai, China(上海交通大学) Shanghai AI Laboratory, Shanghai, China(上海人工智能实验室)

专题命中 Agent评测 :agent(title,abstract);multi-agent(title,abstract)

AI总结 MACEval通过多智能体持续评估网络,提出新的度量标准以动态评估大型模型,减少评估开销并提升评估效率。

Comments 32 pages, 14 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.01723 2026-01-06 cs.CR 88%

Structural Representations for Cross-Attack Generalization in AI Agent Threat Detection

结构表示用于AI代理威胁检测中的跨攻击泛化

Vignesh Iyer

专题命中 Agent评测 :agent(title,abstract);AI agent(title,abstract)

AI总结 本文提出结构标记化方法,通过编码执行流程模式提升AI代理威胁检测的跨攻击泛化能力,显著提高对未知攻击的识别性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.21967 2025-10-28 cs.HC cs.CY 88%

We Need Accountability in Human-AI Agent Relationships

Benjamin Lange, Geoff Keeling, Arianna Manzini, Amanda McCroskery

专题命中 Agent评测 :agent(title,abstract);AI agent(title,abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.10086 2025-10-14 cs.RO 88%

Beyond ADE and FDE: A Comprehensive Evaluation Framework for Safety-Critical Prediction in Multi-Agent Autonomous Driving Scenarios

Feifei Liu, Haozhe Wang, Zejun Wei, Qirong Lu, Yiyang Wen, Xiaoyu Tang, Jingyan Jiang, Zhijian He

机构 * South China Normal University(华南师范大学) Shenzhen Technology University(深圳技术大学)

专题命中 Agent评测 :agent(title,abstract);multi-agent(title,abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.00069 2025-10-02 cs.CV 88%

OIG-Bench: A Multi-Agent Annotated Benchmark for Multimodal One-Image Guides Understanding

Jiancong Xie, Wenjin Wang, Zhuomeng Zhang, Zihan Liu, Qi Liu, Ke Feng, Zixun Sun, Yuedong Yang

机构 * School of Computer Science and Engineering, Sun Yat-sen University, China(中山大学计算机科学与工程学院) Interactive Entertainment Group, Tencent Inc, China(腾讯互动娱乐集团) Key Laboratory of Machine Intelligence and Advanced Computing (MOE), China(机器智能与先进计算重点实验室)

专题命中 Agent评测 :agent(title,abstract);multi-agent(title,abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.00384 2025-08-04 cs.RO 88%

On Learning Closed-Loop Probabilistic Multi-Agent Simulator

Juanwu Lu, Rohit Gupta, Ahmadreza Moradipari, Kyungtae Han, Ruqi Zhang, Ziran Wang

机构 * Purdue University(普渡大学) Toyota InfoTech Labs(丰田信息科技实验室)

专题命中 Agent评测 :agent(title,abstract);multi-agent(title,abstract)

Comments Accepted to IEEE/RSJ International Conference on Intelligent Robots and Systems (IROS) 2025. Source Code: https://github.com/juanwulu/niva

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.23194 2025-08-01 cs.CL cs.AI cs.LG 88%

Geak: Introducing Triton Kernel AI Agent & Evaluation Benchmarks

Jianghui Wang, Vinay Joshi, Saptarshi Majumder, Xu Chao, Bin Ding, Ziqiong Liu, Pratik Prabhanjan Brahma, Dong Li, Zicheng Liu, Emad Barsoum

机构 * Advanced Micro Devices, Inc.(先进微器件公司)

专题命中 Agent评测 :agent(title);AI agent(title);agentic(abstract);分类 cs.AI、cs.CL、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.21969 2025-07-30 cs.MA 88%

Towards Cognitive Synergy in LLM-Based Multi-Agent Systems: Integrating Theory of Mind and Critical Evaluation

Adam Kostka, Jarosław A. Chudziak

专题命中 Agent评测 :agent(title,abstract);multi-agent(title,abstract)

Comments Accepted at CogSci 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.09255 2025-07-15 cs.CE cs.MA 88%

StockSim: A Dual-Mode Order-Level Simulator for Evaluating Multi-Agent LLMs in Financial Markets

Charidimos Papadakis, Giorgos Filandrianos, Angeliki Dimitriou, Maria Lymperaiou, Konstantinos Thomas, Giorgos Stamou

专题命中 Agent评测 :agent(title,abstract);multi-agent(title,abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.11897 2025-05-27 cs.GT econ.TH 88%

Equilibria under Dynamic Benchmark Consistency in Non-Stationary Multi-Agent Systems

Ludovico Crippa, Yonatan Gur, Bar Light

专题命中 Agent评测 :agent(title,abstract);multi-agent(title,abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.09936 2025-05-16 cs.HC cs.GR cs.MA cs.MM 88%

CartoAgent: a multimodal large language model-powered multi-agent cartographic framework for map style transfer and evaluation

Chenglong Wang, Yuhao Kang, Zhaoya Gong, Pengjun Zhao, Yu Feng, Wenjia Zhang, Ge Li

专题命中 Agent评测 :agent(title,abstract);multi-agent(title,abstract)

Comments 57 pages, 17 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.09227 2025-04-15 cs.HC 88%

SceneScout: Towards AI Agent-driven Access to Street View Imagery for Blind Users

Gaurav Jain, Leah Findlater, Cole Gleason

专题命中 Agent评测 :agent(title,abstract);AI agent(title,abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.17258 2025-01-30 cs.HC 88%

Controlling AI Agent Participation in Group Conversations: A Human-Centered Approach

Stephanie Houde, Kristina Brimijoin, Michael Muller, Steven I. Ross, Dario Andres Silva Moran, Gabriel Enrique Gonzalez, Siya Kunde, Morgan A. Foreman, Justin D. Weisz

专题命中 Agent评测 :agent(title,abstract);AI agent(title,abstract)

Comments 31 pages, 7 figures. In Proceedings of the 30th International Conference on Intelligent User Interfaces (IUI '25), March 24-27, 2025, Cagliari, Italy

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.08875 2024-12-13 cs.NE cs.ET q-bio.NC 88%

Brain-inspired AI Agent: The Way Towards AGI

Bo Yu, Jiangning Wei, Minzhen Hu, Zejie Han, Tianjian Zou, Ye He, Jun Liu

专题命中 Agent评测 :agent(title,abstract);AI agent(title,abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2409.14605 2024-09-25 eess.SY cs.SY 88%

First Field Trial of LLM-Powered AI Agent for Lifecycle Management of Autonomous Driving Optical Networks

Xiaomin Liu, Qizhi Qiu, Yihao Zhang, Yuming Cheng, Lilin Yi, Weisheng Hu, Qunbi Zhuge

专题命中 Agent评测 :agent(title,abstract);AI agent(title,abstract)

Comments Version submitted to ECOC PDP 2024 on September 6th

详情

展开后加载摘要…

URL PDF HTML 收藏
2309.16307 2024-03-15 cs.CE 88%

TaxAI: A Dynamic Economic Simulator and Benchmark for Multi-Agent Reinforcement Learning

Qirui Mi, Siyu Xia, Yan Song, Haifeng Zhang, Shenghao Zhu, Jun Wang

专题命中 Agent评测 :agent(title,abstract);multi-agent(title,abstract)

Comments 18 pages, 8 figures, 13 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2311.12045 2023-11-22 q-bio.GN 88%

Using Guided Transfer Learning to Predispose AI Agent to Learn Efficiently from Small RNA-sequencing Datasets

Kevin Li, Danko Nikolić, Vjekoslav Nikolić, Davor Andrić, Lauren M. Sanders, Sylvain V. Costes

专题命中 Agent评测 :agent(title,abstract);AI agent(title,abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2209.01838 2022-09-07 cs.RO 88%

A Benchmark for Unsupervised Anomaly Detection in Multi-Agent Trajectories

Julian Wiederer, Julian Schmidt, Ulrich Kressel, Klaus Dietmayer, Vasileios Belagiannis

专题命中 Agent评测 :agent(title,abstract);multi-agent(title,abstract)

Comments 8 pages, 4 figures, 2 tables, accepted by IEEE ITSC 2022

详情

展开后加载摘要…

URL PDF HTML 收藏
1903.01373 2019-10-07 cs.MA cs.GT 88%

$α$-Rank: Multi-Agent Evaluation by Evolution

Shayegan Omidshafiei, Christos Papadimitriou, Georgios Piliouras, Karl Tuyls, Mark Rowland, Jean-Baptiste Lespiau, Wojciech M. Czarnecki, Marc Lanctot, Julien Perolat, Remi Munos

专题命中 Agent评测 :agent(title,abstract);multi-agent(title,abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.04018 2026-08-06 cs.CY cs.AI 新提交 87%

Governing Execution Risk in Agentic AI Systems: A Trajectory-Guided Framework for Red Teaming

管控智能体AI系统的执行风险:一种基于轨迹的红队测试框架

Zhihao Zhu, Yi Yang

专题命中 Agent评测 :agentic(title,abstract);agent(abstract);AI agent(abstract);tool use(abstract)

AI总结 本研究提出基于轨迹的红队测试框架TrajRed和运行时管控层TrajGuard,在AgentDojo实验中,TrajRed识别的漏洞更强,TrajGuard可将攻击成功率降至近零且保留任务效用。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.03499 2026-08-05 cs.AI 新提交 87%

WeClawArena: An Auditable Sandbox and Benchmark for Cross-User Agents Collaboration and Security in Human-Centered Agent Networks

WeClawArena:面向以人为中心的智能体网络中跨用户智能体协作与安全的可审计沙箱及基准

Prince Zizhuang Wang, Aojie Yuan, Haiyue Zhang, Xiyang Hu, Yue Zhao, Shuli Jiang

专题命中 Agent评测 :agent(title,abstract);AI agent(abstract);tool use(abstract);tool-use(abstract)

AI总结 WeClawArena是面向以人为中心的智能体网络的可审计沙箱与基准,含124个基础任务及620个场景变体,可评估跨用户智能体协作的效用与攻击成功率,支持安全审计与诊断。

Comments 31 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.02683 2026-08-05 cs.CR cs.AI 新提交 87%

$S^3$: Improving Agent Safety through Multi-Stage Defense

$S^3$:通过多阶段防御提升智能体安全性

Zibo Xiao, Haoyu Wang, Jun Sun

专题命中 Agent评测 :agent(title,abstract);planning(abstract);workflow(abstract);agentic(abstract)

AI总结 本研究针对LLM智能体工作流的跨阶段安全风险问题,提出多阶段防御框架$S^3$,引入阶段特定安全技能,构建MSRB基准,实验显示其安全有效性和效用保留均优于现有基线。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.02441 2026-08-04 cs.AI 新提交 87%

Agentic Commerce World: An Auditable and Verifiable Environment for Vibe Commerce

智能体商业世界:一种可审计可验证的氛围式商业环境

Shicheng Fan, Mingdai Yang, Duohao Wang, Canyu Chen, Yongfeng Zhang, Hua Wei, Manling Li, Julian McAuley, Kun Zhang, Philip S. Yu, Kejing Yu, Zhiwei Liu

机构 * University of Illinois at Chicago(伊利诺伊大学芝加哥分校) Springbrand(斯普林布兰德公司) Northwestern University(西北大学) Rutgers University(罗格斯大学) Arizona State University(亚利桑那州立大学) University of California San Diego(加州大学圣迭戈分校) Carnegie Mellon University(卡内基梅隆大学) MBZUAI(Mohamed bin Zayed 人工智能大学) Microsoft AI(微软人工智能部门)

专题命中 Agent评测 :agentic(title,abstract);agent(abstract);AI agent(abstract);分类 cs.AI

AI总结 该研究提出智能体商业世界(ACWorld)环境,通过氛围式商业协议(VCP)实现可审计可验证的氛围式商业智能体评估,构建含两类轨道的基准并验证模型性能,分析得出过程级证据对评估智能体的必要性。

详情

展开后加载摘要…

URL PDF HTML 收藏