arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

AI Agent

智能体、工具调用、规划、工作流、多智能体和自主任务执行。

共收录 15801 信号源:cs.AI, cs.CL, cs.LG, cs.SE

1. Agent评测 15801 篇

2509.10147 2025-09-15 cs.AI 83%

Virtual Agent Economies

Nenad Tomasev, Matija Franklin, Joel Z. Leibo, Julian Jacobs, William A. Cunningham, Iason Gabriel, Simon Osindero

机构 * Google DeepMind(谷歌DeepMind) University of Toronto(多伦多大学)

专题命中 Agent评测 :agent(title,abstract);AI agent(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.02773 2025-09-15 cs.CY cs.AI econ.GN q-fin.EC 83%

Web3 x AI Agents: Landscape, Integrations, and Foundational Challenges

Yiming Shen, Jiashuo Zhang, Zhenzhe Shao, Wenxuan Luo, Yanlin Wang, Ting Chen, Zibin Zheng, Jiachi Chen

专题命中 Agent评测 :AI agent(title,abstract);agent(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.23643 2025-09-04 cs.CR cs.AI 83%

Securing AI Agents with Information-Flow Control

Manuel Costa, Boris Köpf, Aashish Kolluri, Andrew Paverd, Mark Russinovich, Ahmed Salem, Shruti Tople, Lukas Wutschitz, Santiago Zanella-Béguelin

专题命中 Agent评测 :AI agent(title,abstract);agent(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.06821 2025-09-01 cs.CL 83%

Inducing Programmatic Skills for Agentic Tasks

Zora Zhiruo Wang, Apurva Gandhi, Graham Neubig, Daniel Fried

机构 * Carnegie Mellon University(卡内基梅隆大学)

专题命中 Agent评测 :agentic(title);agent(abstract);planning(abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.21411 2025-09-01 cs.AI 83%

CARJAN: Agent-Based Generation and Simulation of Traffic Scenarios with AJAN

Leonard Frank Neis, Andre Antakli, Matthias Klusch

机构 * institutetext: German Research Center for Artificial Intelligence (DFKI) Saarland Informatics Campus, Saarbruecken, Germany(德国人工智能研究中心(DFKI)萨尔兰州信息学校区,萨尔布吕肯,德国)

专题命中 Agent评测 :agent(title,abstract);multi-agent(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.15164 2025-08-22 cs.CL 83%

ContextualLVLM-Agent: A Holistic Framework for Multi-Turn Visually-Grounded Dialogue and Complex Instruction Following

Seungmin Han, Haeun Kwon, Ji-jun Park, Taeyang Yoon

机构 * Dongguk University(东国大学)

专题命中 Agent评测 :agent(title,abstract);planning(abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.12259 2025-08-22 cs.CR cs.AI cs.ET 83%

Fortifying the Agentic Web: A Unified Zero-Trust Architecture Against Logic-layer Threats

Ken Huang, Yasir Mehmood, Hammad Atta, Jerry Huang, Muhammad Zeeshan Baig, Sree Bhargavi Balija

机构 * Qorvex Consulting Kleiner Perkins Wentworth Institute of Higher Education

专题命中 Agent评测 :agentic(title,abstract);agent(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.05508 2025-08-08 cs.AI 83%

Auto-Eval Judge: Towards a General Agentic Framework for Task Completion Evaluation

Roshita Bhonsle, Rishav Dutta, Sneha Vavilapalli, Harsh Seth, Abubakarr Jaye, Yapei Chang, Mukund Rungta, Emmanuel Aboah Boateng, Sadid Hasan, Ehi Nosakhare, Soundar Srinivasan

机构 * University of Massachusetts Amherst(马萨诸塞大学阿姆赫斯特分校) Microsoft Corporation(微软公司) University of Maryland(马里兰大学)

专题命中 Agent评测 :agentic(title,abstract);agent(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.01581 2025-08-05 cs.AI math.CO stat.CO 83%

Polymorphic Combinatorial Frameworks (PCF): Guiding the Design of Mathematically-Grounded, Adaptive AI Agents

David Pearl, Matthew Murphy, James Intriligator

机构 * Department of Mechanical Engineering Tufts University(机械工程系 塔夫茨大学)

专题命中 Agent评测 :AI agent(title,abstract);agent(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.17186 2025-08-01 cs.CL 83%

FinGAIA: A Chinese Benchmark for AI Agents in Real-World Financial Domain

Lingfeng Zeng, Fangqi Lou, Zixuan Wang, Jiajie Xu, Jinyi Niu, Mengping Li, Yifan Dong, Qi Qi, Wei Zhang, Ziwei Yang, Jun Han, Ruilun Feng, Ruiqi Hu, Lejie Zhang, Zhengbo Feng, Yicheng Ren, Xin Guo, Zhaowei Liu, Dongpo Cheng, Weige Cai, Liwen Zhang

专题命中 Agent评测 :AI agent(title,abstract);agent(abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.21017 2025-07-29 cs.AI 83%

MIRAGE-Bench: LLM Agent is Hallucinating and Where to Find Them

Weichen Zhang, Yiyou Sun, Pohao Huang, Jiayue Pu, Heyue Lin, Dawn Song

专题命中 Agent评测 :agent(title,abstract);agentic(abstract);分类 cs.AI

Comments Code and data: https://github.com/sunblaze-ucb/mirage-bench.git

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.13729 2025-07-21 cs.RO cs.AI 83%

AGENTS-LLM: Augmentative GENeration of Challenging Traffic Scenarios with an Agentic LLM Framework

Yu Yao, Salil Bhatnagar, Markus Mazzola, Vasileios Belagiannis, Igor Gilitschenski, Luigi Palmieri, Simon Razniewski, Marcel Hallgarten

专题命中 Agent评测 :agentic(title,abstract);agent(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.06323 2025-07-10 cs.CR cs.AI 83%

Bridging AI and Software Security: A Comparative Vulnerability Assessment of LLM Agent Deployment Paradigms

Tarek Gasmi, Ramzi Guesmi, Ines Belhadj, Jihene Bennaceur

专题命中 Agent评测 :agent(title,abstract);function calling(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.16248 2025-07-10 cs.CR cs.AI 83%

Real AI Agents with Fake Memories: Fatal Context Manipulation Attacks on Web3 Agents

Atharv Singh Patlan, Peiyao Sheng, S. Ashwin Hebbar, Prateek Mittal, Pramod Viswanath

机构 * Princeton University Princeton University \& Sentient Foundation

专题命中 Agent评测 :AI agent(title,abstract);agent(abstract);分类 cs.AI

Comments 19 pages, 14 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.01861 2025-07-10 cs.DC cs.AI cs.MA 83%

Towards Enterprise-Ready Computer Using Generalist Agent

Sami Marreed, Alon Oved, Avi Yaeli, Segev Shlomov, Ido Levy, Offer Akrabi, Aviad Sela, Asaf Adi, Nir Mashkif

机构 * IBM Research(IBM研究院)

专题命中 Agent评测 :agent(title,abstract);agentic(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.01931 2025-07-09 cs.CL 83%

On the Role of Feedback in Test-Time Scaling of Agentic AI Workflows

Souradip Chakraborty, Mohammadreza Pourreza, Ruoxi Sun, Yiwen Song, Nino Scherrer, Furong Huang, Amrit Singh Bedi, Ahmad Beirami, Jindong Gu, Hamid Palangi, Tomas Pfister

机构 * Google(谷歌) University of Maryland(马里兰大学) University of Central Florida(中央佛罗里达大学)

专题命中 Agent评测 :agentic(title,abstract);agent(abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.03493 2025-07-08 cs.CL 83%

AI-VaxGuide: An Agentic RAG-Based LLM for Vaccination Decisions

Abdellah Zeggai, Ilyes Traikia, Abdelhak Lakehal, Abdennour Boulesnane

机构 * Department of Fundamental Computing and its Applications, Faculty of NTIC(基础计算及其应用系) BIOSTIM Laboratory, Medicine Faculty Salah Boubnider Constantine 03 University(BIOSTIM实验室,医学系Salah Boubnider Constantine 03大学)

专题命中 Agent评测 :agentic(title,abstract);agent(abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.08842 2025-07-01 cs.CR cs.CL 83%

LibVulnWatch: A Deep Assessment Agent System and Leaderboard for Uncovering Hidden Vulnerabilities in Open-Source AI Libraries

Zekun Wu, Seonglae Cho, Umar Mohammed, Cristian Munoz, Kleyton Costa, Xin Guan, Theo King, Ze Wang, Emre Kazim, Adriano Koshiyama

机构 * Holistic AI University College London(伦敦大学学院)

专题命中 Agent评测 :agent(title,abstract);agentic(abstract);分类 cs.CL

Comments ACL 2025 Student Research Workshop and ICML 2025 TAIG Workshop

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.20806 2025-06-27 cs.CR cs.AI 83%

Poster: Enhancing GNN Robustness for Network Intrusion Detection via Agent-based Analysis

Zhonghao Zhan, Huichi Zhou, Hamed Haddadi

机构 * Department of Computing Imperial College London(计算系伦敦帝国理工学院)

专题命中 Agent评测 :agent(title,abstract);agentic(abstract);分类 cs.AI

Comments Poster accepted at the 10th IEEE European Symposium on Security and Privacy (Euro S&P 2025)

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.14539 2025-06-27 cs.AI cs.CR 83%

Doppelganger Method: Breaking Role Consistency in LLM Agent via Prompt-based Transferable Adversarial Attack

Daewon Kang, YeongHwan Shin, Doyeon Kim, Kyu-Hwan Jung, Meong Hi Son

机构 * Research Institute for Future Medicine, Samsung Medical Center(未来医学研究所,三星医疗中心) Department of Digital Health, SAIHST, Sungkyunkwan University(数字健康系,SAIHST,成均馆大学) Department of Medical Device Management and Research, SAIHST, Sungkyunkwan University(医疗设备管理与研究系,SAIHST,成均馆大学) Department of Emergency Medicine, Samsung Medical Center(急诊医学系,三星医疗中心)

专题命中 Agent评测 :agent(title,abstract);autonomous agent(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.12636 2025-06-17 cs.LG 83%

Mapping Neural Signals to Agent Performance, A Step Towards Reinforcement Learning from Neural Feedback

Julia Santaniello, Matthew Russell, Benson Jiang, Donatello Sassaroli, Robert Jacob, Jivko Sinapov

机构 * Department of Computer Science Tufts University(计算机科学系塔夫茨大学)

专题命中 Agent评测 :agent(title,abstract);autonomous agent(abstract);分类 cs.LG

Journal ref Conference on Reinforcement Learning and Decision Making (RLDM) 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.17861 2025-05-26 cs.AI cs.CY cs.IR 83%

Superplatforms Have to Attack AI Agents

Jianghao Lin, Jiachen Zhu, Zheli Zhou, Yunjia Xi, Weiwen Liu, Yong Yu, Weinan Zhang

专题命中 Agent评测 :AI agent(title,abstract);agent(abstract);分类 cs.AI

Comments Position paper under review

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.15872 2025-05-26 cs.IR cs.CL 83%

InfoDeepSeek: Benchmarking Agentic Information Seeking for Retrieval-Augmented Generation

Yunjia Xi, Jianghao Lin, Menghui Zhu, Yongzhao Xiao, Zhuoying Ou, Jiaqi Liu, Tong Wan, Bo Chen, Weiwen Liu, Yasheng Wang, Ruiming Tang, Weinan Zhang, Yong Yu

机构 * Shanghai Jiao Tong University(上海交通大学) Huawei Noah’s Ark Lab(华为诺亚实验室)

专题命中 Agent评测 :agentic(title,abstract);agent(abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.14893 2025-05-22 cs.CY cs.AI cs.NE 83%

On the Day They Experience: Awakening Self-Sovereign Experiential AI Agents

Botao Amber Hu, Helena Rong

机构 * Reality Design Lab(现实设计实验室) New York University(纽约大学)

专题命中 Agent评测 :AI agent(title,abstract);agent(abstract);分类 cs.AI

Comments Submitted to Aarhus 2025 Conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.14470 2025-05-21 cs.CL 83%

Agent-SafetyBench: Evaluating the Safety of LLM Agents

Zhexin Zhang, Shiyao Cui, Yida Lu, Jingzhuo Zhou, Junxiao Yang, Hongning Wang, Minlie Huang

专题命中 Agent评测 :agent(title,abstract);tool use(abstract);分类 cs.CL

Comments 26 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.10670 2025-05-19 cs.AI cs.CY cs.GT 83%

Interpretable Risk Mitigation in LLM Agent Systems

Jan Chojnacki

机构 * Department of Physics, University of Warsaw(华沙大学物理系) Samsung R&D Institute Poland(三星波兰研发中心)

专题命中 Agent评测 :agent(title,abstract);autonomous agent(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.08765 2025-05-15 cs.CV cs.AI 83%

Towards Autonomous UAV Visual Object Search in City Space: Benchmark and Agentic Methodology

Yatai Ji, Zhengqiu Zhu, Yong Zhao, Beidan Liu, Chen Gao, Yihao Zhao, Sihang Qiu, Yue Hu, Quanjun Yin, Yong Li

机构 * State Key Lab of Digital-Intelligent Modeling and Simulation(数字智能建模与仿真国家重点实验室) Department of Electronic Engineering, Tsinghua University(清华大学电子工程系)

专题命中 Agent评测 :agentic(title,abstract);planning(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.05115 2025-05-09 cs.AI 83%

Is there a half-life for the success rates of AI agents?

Toby Ord

专题命中 Agent评测 :AI agent(title,abstract);agent(abstract);分类 cs.AI

Comments 9 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.03973 2025-05-08 cs.CL 83%

Divide, Optimize, Merge: Fine-Grained LLM Agent Optimization at Scale

Jiale Liu, Yifan Zeng, Shaokun Zhang, Chi Zhang, Malte Højmark-Bertelsen, Marie Normann Gadeberg, Huazheng Wang, Qingyun Wu

机构 * Pennsylvania State University(宾夕法尼亚州立大学) Oregon State University(俄勒冈州立大学) The University of Texas at Austin(德克萨斯大学奥斯汀分校) Beyond Work

专题命中 Agent评测 :agent(title,abstract);agentic(abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.21433 2025-05-01 cs.AI 83%

NGENT: Next-Generation AI Agents Must Integrate Multi-Domain Abilities to Achieve Artificial General Intelligence

Zhicong Li, Hangyu Mao, Jiangjin Yin, Mingzhe Xing, Zhiwei Xu, Yuanxing Zhang, Yang Xiao

专题命中 Agent评测 :AI agent(title,abstract);agent(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏