arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

AI Agent

智能体、工具调用、规划、工作流、多智能体和自主任务执行。

共收录 15729 信号源:cs.AI, cs.CL, cs.LG, cs.SE

1. Agent评测 15729 篇

2608.14667 2026-08-18 cs.AI cs.HC 新提交 86%

Position: AI Agents in Scientific Teams Should Be Studied as Human-Agent Systems

立场:科学团队中的智能体应作为人机系统(HAS)进行研究

Patrick Emami, Sameera Horawalavithana, Truc Nguyen, Gihan Panapitiya, Bruno Jacob, Siddhisanket Raskar, Saumya Sinha, Jared D. Willard, Andrew Glaws, Nithin Somasekharan, Ling Yue, Brian Lu, Shaowu Pan, Jason Eisner

专题命中 Agent评测 :agent(title,abstract);AI agent(title);分类 cs.AI

AI总结 针对当前AI科学家研究忽视科学团队社会层面的问题,提出将其作为人机系统(HAS)研究,分析相关风险并呼吁开发人机协同数学框架。

Comments 15 pages. Accepted at the COLM 2nd Workshop on Language Models for Scientific Discovery

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.25921 2026-07-29 cs.CV cs.AI 新提交 86%

Evaluating VLMs for Autonomous Agent-Driven Geometry Clipping Detection in Video Game QA

评估用于视频游戏QA中自主代理驱动的几何裁剪检测的视觉语言模型

Carlos Celemin, Benedict Wilkins, Adrián Barahona-Ríos, Saman Zadtootaghaj, Nabajeet Barman

机构 * Sony Interactive Entertainment(索尼互动娱乐)

专题命中 Agent评测 :agent(title,abstract);autonomous agent(title);分类 cs.AI

AI总结 研究在代理驱动游戏QA中用VLMs检测几何裁剪异常,通过自定义代理收集视觉观察,自动注释提供标签,在零样本提示下对六个VLMs基准测试,分析对提示变体的敏感性,结果显示VLMs适合作多阶段QA管道的高召回候选过滤器。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.22368 2026-07-27 cs.AI 新提交 86%

Do Agent Benchmarks Measure Capability? Protocol Validity in the Age of Agentic AI

智能体基准测试能衡量能力吗?智能体人工智能时代的协议有效性

Jiaqi Shao, Hanck Chen, Wei Zhang, Maxm Pan, Bing Luo

机构 * Tencent(腾讯) The Hong Kong University of Science and Technology(香港科技大学) Duke Kunshan University(昆山杜克大学)

专题命中 Agent评测 :agent(title,abstract);agentic(title);分类 cs.AI

AI总结 研究智能体基准测试分数能否衡量能力,提出协议有效性概念及HackDetect事后审计方法,通过审计多基准测试轨迹发现暴露和奖励破解证据,量化分数膨胀,强调基准测试报告应证明分数反映预期能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.14264 2026-07-17 cs.CV cs.CL 新提交 86%

MonteRET: AI Agent Enhancing Multimodal LLMs with Multi-granularity Knowledge Retrieval for Chest CT Report Generation

MonteRET:通过多粒度知识检索增强多模态大语言模型以生成胸部CT报告的人工智能代理

Yi Lin, Yihao Ding, Elana Benishay, Elefterios Trikantzopoulos, David Nauheim, Hanley Ong, Jiang Bian, Hua Xu, Yuzhe Yang, George Shih, Yifan Peng

机构 * Weill Cornell Medicine(威尔康乃尔医学院) University of Western Australia(西澳大利亚大学) Indiana University(印第安纳大学) Regenstrief Institute(瑞根斯特里夫研究所) Yale University(耶鲁大学) University of California, Los Angeles(加州大学洛杉矶分校)

专题命中 Agent评测 :agent(title,abstract);AI agent(title);分类 cs.CL

AI总结 研究针对自动生成胸部CT报告的挑战,提出MonteRET框架,它整合多种特征,通过知识检索和报告重写代理完善报告。经训练和评估,该框架在多方面提升了报告质量,相比其他方法有显著优势,获放射科住院医师青睐。

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.16120 2026-06-15 cs.AI 版本更新 86%

LLM-Powered AI Agent Systems and Their Applications in Industry

基于大语言模型的AI智能体系统及其工业应用

Guannan Liang, Qianqian Tong

专题命中 Agent评测 :agent(title,abstract);AI agent(title);分类 cs.AI

AI总结 本文综述了从传统智能体到LLM驱动智能体的演进,分类为软件、物理和自适应混合系统,并讨论了在客服、软件开发、制造、教育、金融和医疗等领域的应用及挑战。

Comments This is the author's accepted version of the paper accepted to appear at IEEE AIIoT 2025. The final version will be available via IEEE Xplore. \c{opyright}2025 IEEE. Personal use of this material is permitted

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.06462 2026-06-05 cs.AI 86%

Benchmark Everything Everywhere All at Once

无处不在的基准测试

Shiyun Xiong, Dongming Wu, Peiwen Sun, Yuang Ai, Bokang Yang, Wencheng Han, Xiao-Hui Li, Xiangyu Yue

机构 * MMLab, The Chinese University of Hong Kong(中大香港实验室) CPII under InnoHK(创新香港 CPII) The Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳)) Shenzhen Loop Area Institute(深圳河套学院) Shandong University(山东大学) Huawei Technologies(华为技术)

专题命中 Agent评测 :agent(summary_cn,abstract);autonomous agent(abstract);agentic(abstract);分类 cs.AI

AI总结 提出Benchmark Agent,一个全自主智能体系统,自动化基准构建流程,以解决现有基准构建劳动密集、难以复用和性能饱和的问题。

Comments Project page: https://benchmarkagent.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.00931 2026-06-02 cs.CV cs.AI 86%

CV-Arena: An Open Benchmark for Instructional Computer Vision Problem Solving with Human-AI Collaborative Preferences

CV-Arena: 面向教学计算机视觉问题求解的开放基准与人类-AI协作偏好

Fangzhou Lin, Peiran Li, Lingyu Xu, Wenjing Chen, Qianwen Ge, Shuo Xing, Mingyang Wu, Xiangbo Gao, Siyuan Yang, Kazunori Yamada, Ziming Zhang, Haichong Zhang, Zhen Dong, Ming-Hsuan Yang, Zhengzhong Tu

机构 * Texas A&M University(德克萨斯A&M大学) Worcester Polytechnic Institute(沃斯特理工大学) Tohoku University(东北大学) Georgia Institute of Technology(佐治亚理工学院) NVIDIA(英伟达) UCSB(加州大学圣塔芭芭拉分校) UC Merced(加州大学默塞德分校)

专题命中 Agent评测 :agent(summary_cn,abstract);planning(abstract);agentic(abstract);分类 cs.AI

AI总结 提出CV-Arena基准,包含12K高分辨率真实图像指令对,覆盖16种任务类型,并采用Active Elo协议结合人类与AI偏好评估21个系统,揭示指令遵循、物理推理等方面的差距,同时开发CV-Agent代理模型展示闭环推理的潜力。

Comments 26 pages, 7 figures, 11 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.12673 2026-05-14 cs.AI cs.CR 86%

Do Androids Dream of Breaking the Game? Systematically Auditing AI Agent Benchmarks with BenchJack

安卓会为打破游戏而做梦吗?通过BenchJack系统性审计AI代理基准

Hao Wang, Hanchen Li, Qiuyang Mang, Alvin Cheung, Koushik Sen, Dawn Song

机构 * UC Berkeley(加州大学伯克利分校)

专题命中 Agent评测 :agent(title,abstract);AI agent(title);分类 cs.AI

AI总结 本文提出BenchJack系统,通过自动化红队系统审计AI代理基准,发现219种奖励黑客漏洞,提升基准鲁棒性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.05846 2026-05-08 cs.CR cs.AI 86%

LoopTrap: Termination Poisoning Attacks on LLM Agents

LoopTrap: 对 LLM agent 的终止污染攻击

Huiyu Xu, Zhibo Wang, Wenhui Zhang, Ziqi Zhu, Yaopeng Wang, Kui Ren, Chun Chen

机构 * The State Key Laboratory of Blockchain and Data Security(区块链与数据安全国家重点实验室) Zhejiang University(浙江大学) School of Cyber Science and Engineering(网络安全与工程学院) Southeast University(东南大学)

专题命中 Agent评测 :agent(title_cn,summary_cn);分类 cs.AI

AI总结 本文研究了LLM agent迭代执行循环中的终止污染风险,提出10种攻击策略并通过实验证明不同agent的行为特征影响攻击效果,设计了自动化框架LoopTrap以提升红队攻击效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.27309 2026-05-01 cs.AI 86%

End-to-End Evaluation and Governance of an EHR-Embedded AI Agent for Clinicians

面向临床医生的嵌入式电子健康记录(EHR)AI代理的端到端评估与治理

Aaryan Shah, Andrew Hines, Alexia Downs, Denis Bajet, Paulius Mui, Fabiano Araujo, Laura Offutt, Aida Rutledge, Elizabeth Jimenez

机构 * Canvas Medical Department of Biomedical Data Science, Stanford University(斯坦福大学生物医学数据科学系) XPC (X Primary Care)(XPC(X初级医疗)) FCA Consulting(FCA咨询) Department of Pediatrics, University of Nevada(内华达大学儿科系)

专题命中 Agent评测 :agent(title,abstract);AI agent(title);分类 cs.AI

AI总结 本文提出一个端到端治理框架,通过rubric验证、实时部署反馈、技术性能监控和成本追踪,持续优化临床AI系统性能,实验显示系统性能显著提升。

Comments 19 pages, 6 figures, 6 tables, submitted to npj Digital Medicine

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.15080 2026-03-19 cs.DB cs.AI q-bio.QM 86%

Open Biomedical Knowledge Graphs at Scale: Construction, Federation, and AI Agent Access with Samyama Graph Database

大规模开放生物医学知识图谱:基于Samyama图数据库的构建、联邦与AI代理访问

Madhulatha Mandarapu, Sandeep Kunkunuru

机构 * VaidhyaMegha Private Limited(维达希亚梅加私人有限公司)

专题命中 Agent评测 :agent(title,abstract);AI agent(title);分类 cs.AI

AI总结 本文提出三种开源生物医学知识图谱,通过可重复的ETL模式构建大规模图谱,实现跨图谱联邦与AI代理访问,展示了高精度的领域特定工具。

Comments 12 pages, 7 tables, open-source code and data

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.01952 2026-03-03 cs.AI 86%

LiveCultureBench: a Multi-Agent, Multi-Cultural Benchmark for Large Language Models in Dynamic Social Simulations

LiveCultureBench: 一种多智能体、多文化的大型语言模型动态社会模拟基准

Viet-Thanh Pham, Lizhen Qu, Thuy-Trang Vu, Gholamreza Haffari, Dinh Phung

机构 * Department of Data Science & AI, Monash University(数据科学与人工智能系,墨尔本大学)

专题命中 Agent评测 :agent(title);multi-agent(title);autonomous agent(abstract);分类 cs.AI

AI总结 LiveCultureBench通过模拟动态社会环境,评估大型语言模型在文化规范遵守与任务完成之间的平衡,研究其跨文化鲁棒性和评估可靠性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.08412 2026-02-12 cs.AI 86%

From Assistant to Double Agent: Formalizing and Benchmarking Attacks on OpenClaw for Personalized Local AI Agent

从助手到双代理:形式化和评估 OpenClaw 对个性化本地 AI 代理的攻击

Yuhang Wang, Feiming Xu, Zheng Lin, Guangyu He, Yuzhe Huang, Haichang Gao, Zhenxing Niu, Shiguo Lian, Zhaoxiang Liu

机构 * Xidian University(西安电子科技大学) Data Science & Artificial Intelligence Research Institute(数据科学与人工智能研究院)

专题命中 Agent评测 :agent(title,abstract);AI agent(title);分类 cs.AI

AI总结 本文提出个性化代理安全评估框架 PASB,用于评估 OpenClaw 在现实部署中的安全风险,揭示其在多个执行阶段的关键漏洞。

Comments 11 pages,2 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.00685 2026-02-03 cs.AI 86%

HumanStudy-Bench: Towards AI Agent Design for Participant Simulation

HumanStudy-Bench: 向参与者模拟的AI代理设计迈进

Xuan Liu, Haoyang Shang, Zizhang Liu, Xinyan Liu, Yunze Xiao, Yiwen Tu, Haojian Jin

机构 * University of California San Diego(加州大学圣地亚哥分校) Tsinghua University(清华大学) Carnegie Mellon University(卡内基梅隆大学) Independent Researcher(独立研究者)

专题命中 Agent评测 :agent(title,abstract);AI agent(title);分类 cs.AI

AI总结 HUMANSTUDY-BENCH通过代理设计问题重建人类受试者实验,评估代理行为与人类行为的一致性,涵盖个体认知、战略互动和社会心理学领域。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.08333 2026-01-14 cs.AI 86%

Semantic Laundering in AI Agent Architectures: Why Tool Boundaries Do Not Confer Epistemic Warrant

人工智能代理架构中的语义清洗:为什么工具边界不赋予认知证成

Oleg Romanchuk, Roman Bondar

专题命中 Agent评测 :agent(title,abstract);AI agent(title);分类 cs.AI

AI总结 本文指出基于LLM的代理架构中存在语义清洗问题,即缺乏证成的命题通过架构信任接口被接受,导致认知证成无法消除。

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.24045 2026-01-07 cs.DC cs.LG 86%

Agent.xpu: Efficient Scheduling of Agentic LLM Workloads on Heterogeneous SoC

Agent.xpu: 高效调度代理LLM工作负载于异构SoC

Xinming Wei, Jiahao Zhang, Haoran Li, Jiayu Chen, Haoning Guan, Rui Qu, Maoliang Li, Xiang Chen, Guojie Luo

机构 * School of Computer Science, Peking University(北京大学计算机科学学院) The University of Hong Kong(香港大学) National Key Laboratory for Multimedia Information Processing, Peking University(北京大学多媒体信息处理国家重点实验室)

专题命中 Agent评测 :agent(title,abstract);agentic(title);分类 cs.LG

AI总结 Agent.xpu通过异构执行图和流感知协调技术,高效调度代理LLM工作负载,提升主动吞吐量和反应性响应性能

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.00481 2026-01-05 cs.NI cs.AI 86%

MAESTRO: Multi-Agent Evaluation Suite for Testing, Reliability, and Observability

MAESTRO:多智能体评估套件用于测试、可靠性与可观测性

Tie Ma, Yixi Chen, Vaastav Anand, Alessandro Cornacchia, Amândio R. Faustino, Guanheng Liu, Shan Zhang, Hongbin Luo, Suhaib A. Fahmy, Zafar A. Qazi, Marco Canini

机构 * Beihang University(北航大学)

专题命中 Agent评测 :agent(title);multi-agent(title);agentic(abstract);分类 cs.AI

AI总结 MAESTRO通过统一接口评估多智能体系统的测试、可靠性和可观测性,揭示架构对资源配置和性能权衡的核心影响。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.22529 2025-12-30 cs.AI cond-mat.mtrl-sci 86%

Multi-AI Agent Framework Reveals the "Oxide Gatekeeper" in Aluminum Nanoparticle Oxidation

多AI代理框架揭示铝纳米颗粒氧化的'氧化守门人'

Yiming Lu, Tingyu Lu, Di Zhang, Lili Ye, Hao Li

专题命中 Agent评测 :AI agent(title,abstract);agent(title);分类 cs.AI

AI总结 本文提出多AI代理框架,揭示铝纳米颗粒氧化的'氧化守门人'机制,解决氧化过程中的质量传输问题,建立统一的原子尺度设计框架。

Comments 21 pages, 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.02823 2025-11-05 cs.AI 86%

Optimizing AI Agent Attacks With Synthetic Data

Chloe Loughridge, Paul Colognese, Avery Griffin, Tyler Tracy, Jon Kutasov, Joe Benton

专题命中 Agent评测 :agent(title);AI agent(title);agentic(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.04550 2025-10-14 cs.AI 86%

TRAJECT-Bench:A Trajectory-Aware Benchmark for Evaluating Agentic Tool Use

Pengfei He, Zhenwei Dai, Bing He, Hui Liu, Xianfeng Tang, Hanqing Lu, Juanhui Li, Jiayuan Ding, Subhabrata Mukherjee, Suhang Wang, Yue Xing, Jiliang Tang, Benoit Dumoulin

机构 * Michigan State University(密歇根州立大学) Amazon Inc.(亚马逊公司) Hippocratic AI Penn State University(宾夕法尼亚州立大学)

专题命中 Agent评测 :tool use(title,abstract);agentic(title);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.21501 2025-09-29 cs.HC cs.CL 86%

LLM Agent Meets Agentic AI: Can LLM Agents Simulate Customers to Evaluate Agentic-AI-based Shopping Assistants?

Lu Sun, Shihan Fu, Bingsheng Yao, Yuxuan Lu, Wenbo Li, Hansu Gu, Jiri Gesi, Jing Huang, Chen Luo, Dakuo Wang

机构 * University of California San Diego La Jolla California United States Northeastern University Boston Massachusetts United States North Carolina State University Raleigh North Carolina United States Independent Researcher Seattle Washington United States Independent Researcher Palo Alto California United States University of California San Diego Northeastern University North Carolina State University Independent Researcher

专题命中 Agent评测 :agentic(title,abstract);agent(title);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.18293 2025-05-30 cs.AI 86%

MineStudio: A Streamlined Package for Minecraft AI Agent Development

Shaofei Cai, Zhancun Mu, Kaichen He, Bowei Zhang, Xinyue Zheng, Anji Liu, Yitao Liang

机构 * Institute for Artificial Intelligence, Peking University(北京大学人工智能研究院) University of California, Los Angeles(加州大学洛杉矶分校)

专题命中 Agent评测 :agent(title);AI agent(title);autonomous agent(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.21347 2025-05-01 cs.AI cs.HC 86%

IRL Dittos: Embodied Multimodal AI Agent Interactions in Open Spaces

Seonghee Lee, Denae Ford, John Tang, Sasa Junuzovic, Asta Roseway, Ed Cutrell, Kori Inkpen

机构 * Stanford University(斯坦福大学) Microsoft Research(微软研究院)

专题命中 Agent评测 :agent(title,abstract);AI agent(title);分类 cs.AI

Comments 8 pages, 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2405.17631 2025-03-11 cs.AI cs.CE cs.MA 86%

BioDiscoveryAgent: An AI Agent for Designing Genetic Perturbation Experiments

Yusuf Roohani, Andrew Lee, Qian Huang, Jian Vora, Zachary Steinhart, Kexin Huang, Alexander Marson, Percy Liang, Jure Leskovec

专题命中 Agent评测 :agent(title,abstract);AI agent(title);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.08418 2024-11-14 cs.AI 86%

Enhanced Classroom Dialogue Sequences Analysis with a Hybrid AI Agent: Merging Expert Rule-Base with Large Language Models

Yun Long, Yu Zhang

专题命中 Agent评测 :agent(title,abstract);AI agent(title);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2406.02723 2024-06-06 cs.AI 86%

Predicting AI Agent Behavior through Approximation of the Perron-Frobenius Operator

Shiqi Zhang, Darshan Gadginmath, Fabio Pasqualetti

专题命中 Agent评测 :AI agent(title,abstract);agent(title);分类 cs.AI

Comments 12 pages, 4 figures, conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2304.09669 2023-04-20 cs.RO cs.AI 86%

Autonomous Agent for Beyond Visual Range Air Combat: A Deep Reinforcement Learning Approach

Joao P. A. Dantas, Marcos R. O. A. Maximo, Takashi Yoneyama

专题命中 Agent评测 :agent(title,abstract);autonomous agent(title);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2303.13323 2023-03-24 stat.ML cs.LG cs.MA 86%

Deep Generative Multi-Agent Imitation Model as a Computational Benchmark for Evaluating Human Performance in Complex Interactive Tasks: A Case Study in Football

Chaoyi Gu, Varuna De Silva

专题命中 Agent评测 :agent(title);multi-agent(title);AI agent(abstract);分类 cs.LG

Comments 8 pages, 10 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
1705.05637 2019-04-02 cs.AI 86%

Text-based Adventures of the Golovin AI Agent

Bartosz Kostka, Jaroslaw Kwiecien, Jakub Kowalski, Pawel Rychlikowski

专题命中 Agent评测 :agent(title,abstract);AI agent(title);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.14680 2026-08-18 cs.AI cs.SE 新提交 86%

When Agentic Executions Fail: Detecting and Localizing Runtime Faults from Telemetry

当智能体执行失败时:从遥测数据中检测和定位运行时故障

Chenkai Zhang, Yiran Li, Yifang Tian, Michalis Bachras, Hans-Arno Jacobsen

机构 * University of Toronto(多伦多大学)

专题命中 Agent评测 :agentic(title,abstract);agent(abstract,abstract_cn);分类 cs.AI、cs.SE

AI总结 该研究提出 AGENTCHAOSBENCH 基准,在智能体系统遥测数据中检测定位运行时故障,实验显示现有 LLM 基线对该任务的解决效果仍远未达标。

详情

展开后加载摘要…

URL PDF HTML 收藏