arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

AI Agent

智能体、工具调用、规划、工作流、多智能体和自主任务执行。

共收录 15801 信号源:cs.AI, cs.CL, cs.LG, cs.SE

1. Agent评测 15801 篇

2511.18405 2025-11-25 cs.AI cs.HC cs.IR 83%

A Multimodal Conversational Agent for Tabular Data Analysis

面向表格数据分析的多模态对话代理

Mohammad Nour Al Awad, Sergey Ivanov, Olga Tikhonova, Ivan Khodnenko

机构 * ITMO University(ITMO大学)

专题命中 Agent评测 :agent(title,abstract);agentic(abstract);分类 cs.AI

AI总结 Talk2Data是一种多模态对话代理,通过语音和文本交互实现表格数据分析,结合LLM、ASR、代码生成和TTS技术,提供多轮对话和可验证计算。

Comments \c{opyright} 2025 IEEE. Personal use of this material is permitted. Permission from IEEE must be obtained for all other uses

详情

展开后加载摘要…

URL PDF HTML 收藏
2408.15511 2025-11-24 cs.RO cs.AI 83%

AeroVerse: UAV-Agent Benchmark Suite for Simulating, Pre-training, Finetuning, and Evaluating Aerospace Embodied World Models

AeroVerse:用于模拟、预训练、微调和评估航空航天具身世界模型的UAV-Agent基准套件

Fanglong Yao, Yuanchang Yue, Youzhi Liu, Xian Sun, Kun Fu

机构 * Aerospace Information Research Institute, Chinese Academy of Sciences(中国科学院航空信息研究所) University of Chinese Academy of Sciences(中国科学院大学) School of Electronic, Electrical and Communication Engineering, University of Chinese Academy of Sciences(中国科学院大学电子电气与通信工程学院) Key Laboratory of Target Cognition and Application Technology(TCAT), Aerospace Information Research Institute, Chinese Academy of Sciences(中国科学院航空信息研究所目标认知与应用技术重点实验室)

专题命中 Agent评测 :agent(title,abstract);planning(abstract);分类 cs.AI

AI总结 AeroVerse是一个用于模拟、预训练、微调和评估航空航天具身世界模型的基准套件,包含多个数据集和评估指标,旨在推动航空航天具身智能的发展。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.15759 2025-11-21 cs.CR cs.AI 83%

Securing AI Agents Against Prompt Injection Attacks

保护AI代理免受提示注入攻击

Badrinath Ramakrishnan, Akshaya Balaji

专题命中 Agent评测 :AI agent(title,abstract);agent(abstract);分类 cs.AI

AI总结 本文提出了一种多层防御框架,通过评估RAG系统中的提示注入风险,将攻击成功率降低至8.7%,同时保持高任务性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.14136 2025-11-19 cs.AI 83%

Beyond Accuracy: A Multi-Dimensional Framework for Evaluating Enterprise Agentic AI Systems

Sushant Mehta

专题命中 Agent评测 :agentic(title,abstract);agent(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.13860 2025-11-19 econ.GN cs.AI q-fin.EC 83%

Randomized Controlled Trials for Phishing Triage Agent

James Bono

机构 * Microsoft Corporation(微软公司)

专题命中 Agent评测 :agent(title,abstract);AI agent(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.08181 2025-11-18 cs.IR cs.AI 83%

MARC: Multimodal and Multi-Task Agentic Retrieval-Augmented Generation for Cold-Start Recommender System

Seung Hwan Cho, Yujin Yang, Danik Baeck, Minjoo Kim, Young-Min Kim, Heejung Lee, Sangjin Park

机构 * Department of Industrial Data Engineering, Hanyang University, Republic of Korea(工业数据工程系,翰阳大学) School of Interdisciplinary Industrial Studies, Hanyang University, Republic of Korea(跨学科工业研究学院,翰阳大学)

专题命中 Agent评测 :agentic(title,abstract);agent(abstract);分类 cs.AI

Comments 13 pages, 2 figures, Accepted at RDGENAI at CIKM 2025 workshop

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.08042 2025-11-12 cs.AI 83%

Towards a Standard, Enterprise-Relevant Agentic AI Benchmark: Lessons from 5.5 billion tokens' worth of agentic AI evaluations

JV Roig

机构 * Kamiwaza AI

专题命中 Agent评测 :agentic(title,abstract);tool use(abstract);分类 cs.AI

Comments 34 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.04464 2025-11-07 cs.AI 83%

Beyond Shortest Path: Agentic Vehicular Routing with Semantic Context

Carnot Braun, Rafael O. Jarczewski, Gabriel U. Talasso, Leandro A. Villas, Allan M. de Souza

机构 * Institute of Computing (IC)(计算学院) Hub de Inteligência Artificial e Arquiteturas Cognitivas (H.IAAC)(人工智能与认知架构中心) Universidade Estadual de Campinas (UNICAMP)(坎皮纳斯州立大学)

专题命中 Agent评测 :agentic(title,abstract);agent(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.04032 2025-11-07 cs.AI 83%

Detecting Silent Failures in Multi-Agentic AI Trajectories

Divya Pathak, Harshit Kumar, Anuska Roy, Felix George, Mudit Verma, Pratibha Moogi

机构 * IBM Research(IBM研究院) IIIT Bangalore(班加罗尔IIIT)

专题命中 Agent评测 :agentic(title,abstract);agent(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.03051 2025-11-06 cs.AI cs.IR 83%

No-Human in the Loop: Agentic Evaluation at Scale for Recommendation

Tao Zhang, Kehui Yao, Luyi Ma, Jiao Chen, Reza Yousefi Maragheh, Kai Zhao, Jianpeng Xu, Evren Korpeoglu, Sushant Kumar, Kannan Achan

机构 * Walmart Global Tech(沃尔玛全球技术)

专题命中 Agent评测 :agentic(title);agent(abstract);multi-agent(abstract);分类 cs.AI

Comments 4 page, NeurIPS 2025 Workshop: Evaluating the Evolving LLM Lifecycle

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.01218 2025-11-04 cs.LG 83%

Optimizing Electric Vehicle Charging Station Placement Using Reinforcement Learning and Agent-Based Simulations

Minh-Duc Nguyen, Dung D. Le, Phi Long Nguyen

机构 * organization= Center for Environmental Intelligence, VinUniversity , city= Hanoi , country= Vietnam organization= College of Engineering \& Computer Science, VinUniversity , city= Hanoi , country= Vietnam

专题命中 Agent评测 :agent(title,abstract);planning(abstract);分类 cs.LG

Comments Under Review

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.20414 2025-10-28 cs.GR cs.CV cs.LG cs.RO 83%

SceneWeaver: All-in-One 3D Scene Synthesis with an Extensible and Self-Reflective Agent

Yandan Yang, Baoxiong Jia, Shujie Zhang, Siyuan Huang

机构 * State Key Laboratory of General Artificial Intelligence, BIGAI(1 通用人工智能国家重点实验室、BIGAI) Tsinghua University(2 清华大学)

专题命中 Agent评测 :agent(title,abstract);agentic(abstract);分类 cs.LG

Comments Accepted by NeurIPS 2025, 26 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.21524 2025-10-27 cs.AI 83%

EU-Agent-Bench: Measuring Illegal Behavior of LLM Agents Under EU Law

Ilija Lichkovski, Alexander Müller, Mariam Ibrahim, Tiwai Mhundwa

机构 * AI Safety Initiative Groningen(格罗宁根人工智能安全倡议)

专题命中 Agent评测 :agent(title,abstract);agentic(abstract);分类 cs.AI

Comments Accepted at the Workshop on Regulatable ML at the 39th Conference on Neural Information Processing Systems (NeurIPS 2025)

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.18131 2025-10-22 cs.SE 83%

BlueCodeAgent: A Blue Teaming Agent Enabled by Automated Red Teaming for CodeGen AI

Chengquan Guo, Yuzhou Nie, Chulin Xie, Zinan Lin, Wenbo Guo, Bo Li

专题命中 Agent评测 :agent(title,abstract);agentic(abstract);分类 cs.SE

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.17814 2025-10-22 eess.SY cs.AI cs.SY 83%

LLM Assisted Alpha Fairness for 6 GHz WiFi and NR_U Coexistence: An Agentic Orchestrator for Throughput, Energy, and SLA

Qun Wang, Yingzhou Lu, Guiran Liu, Binrong Zhu, Yang Liu

机构 * Department of Computer Science, San Francisco State University(计算机科学系,旧金山州立大学) School of Medicine, Stanford University(医学院,斯坦福大学)

专题命中 Agent评测 :agentic(title,abstract);agent(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.16248 2025-10-21 cs.CL 83%

FinResearchBench: A Logic Tree based Agent-as-a-Judge Evaluation Framework for Financial Research Agents

Rui Sun, Zuo Bai, Wentao Zhang, Yuxiang Zhang, Li Zhao, Shan Sun, Zhengwen Qiu

机构 * Stepfun FinStep

专题命中 Agent评测 :agent(title,abstract);AI agent(abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.02649 2025-10-21 cs.AI 83%

Fully Autonomous AI Agents Should Not be Developed

Margaret Mitchell, Avijit Ghosh, Alexandra Sasha Luccioni, Giada Pistilli

专题命中 Agent评测 :AI agent(title,abstract);agent(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.11108 2025-10-21 cs.MA cs.AI cs.CR 83%

A Vision for Access Control in LLM-based Agent Systems

Xinfeng Li, Dong Huang, Jie Li, Hongyi Cai, Zhenhong Zhou, Wei Dong, XiaoFeng Wang, Yang Liu

机构 * Nanyang Technological University, Singapore(南洋理工大学,新加坡) National University of Singapore, Singapore(国立新加坡大学,新加坡)

专题命中 Agent评测 :agent(title,abstract);agentic(abstract);分类 cs.AI

Comments 11 pages, 1 figure

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.11694 2025-10-14 cs.AI 83%

Operand Quant: A Single-Agent Architecture for Autonomous Machine Learning Engineering

Arjun Sahney, Ram Gorthi, Cezary Łastowski, Javier Vega

机构 * Operand Research(Operand研究)

专题命中 Agent评测 :agent(title,abstract);multi-agent(abstract);分类 cs.AI

Comments 8 pages. No figures. Evaluated on MLE-Benchmark 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.07943 2025-10-10 cs.AI 83%

Agent-Based Genetic Algorithm for Crypto Trading Strategy Optimization

Qiushi Tian, Churong Liang, Kairan Hong, Runnan Li

机构 * Beijing University of Posts and Telecommunications(北京邮电大学)

专题命中 Agent评测 :agent(title,abstract);multi-agent(abstract);分类 cs.AI

Comments 5 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.13524 2025-10-08 cs.CL cs.CY 83%

Agent-Enhanced Large Language Models for Researching Political Institutions

Joseph R. Loffredo, Suyeol Yun

专题命中 Agent评测 :agent(title,abstract);agentic(abstract);分类 cs.CL

Comments 46 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.03984 2025-10-07 cs.IR cs.LG 83%

Beyond Static Evaluation: Rethinking the Assessment of Personalized Agent Adaptability in Information Retrieval

Kirandeep Kaur, Preetam Prabhu Srikar Dammu, Hideo Joho, Chirag Shah

机构 * University of Washington(华盛顿大学) University of Tsukuba(筑波大学)

专题命中 Agent评测 :agent(title,abstract);AI agent(abstract);分类 cs.LG

Journal ref Proceedings of the 2025 Annual International ACM SIGIR Conference on Research and Development in Information Retrieval in the Asia Pacific Region

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.00245 2025-10-07 cs.HC cs.AI 83%

Can AI agents understand spoken conversations about data visualizations in online meetings?

Rizul Sharma, Tianyu Jiang, Seokki Lee, Jillian Aurisano

机构 * DaVInCi Laboratory(DaVInCi实验室) University of Cincinnati(克利夫兰大学)

专题命中 Agent评测 :AI agent(title,abstract);agent(abstract);分类 cs.AI

Journal ref The 2nd MERCADO Workshop at IEEE VIS 2025: Multimodal Experiences for Remote Communication Around Data Online, IEEE VIS 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.00795 2025-10-02 cs.AI 83%

Benchmarking Agentic Systems in Automated Scientific Information Extraction with ChemX

Anastasia Vepreva, Julia Razlivina, Maria Eremeeva, Nina Gubina, Anastasia Orlova, Aleksei Dmitrenko, Ksenya Kapranova, Susan Jyakhwo, Nikita Vasilev, Arsen Sarkisyan, Ivan Yu. Chernyshov, Vladimir Vinogradov, Andrei Dmitrenko

机构 * Center for AI in Chemistry, ITMO University(人工智能化学中心,ITMO大学) D ONE AG(D ONE公司)

专题命中 Agent评测 :agentic(title,abstract);agent(abstract);分类 cs.AI

Comments Accepted at The AI for Accelerated Materials Discovery (AI4Mat) Workshop, NeurIPS 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.09993 2025-10-01 cs.CL 83%

Agent-as-Judge for Factual Summarization of Long Narratives

Yeonseok Jeong, Minsoo Kim, Seung-won Hwang, Byung-Hak Kim

机构 * IPAI, Seoul National University(IPAI,首尔国立大学) Seoul National University(首尔国立大学) Hyundai Card(现代卡)

专题命中 Agent评测 :agent(title,abstract);workflow(abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.01813 2025-09-30 cs.AI 83%

The Ultimate Test of Superintelligent AI Agents: Can an AI Balance Care and Control in Asymmetric Relationships?

Djallel Bouneffouf, Matthew Riemer, Kush Varshney

机构 * IBM Research(IBM研究院)

专题命中 Agent评测 :AI agent(title);agent(abstract);multi-agent(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.23270 2025-09-30 cs.AI 83%

Socio-Economic Model of AI Agents

Yuxinyue Qian, Jun Liu

机构 * Beijing University of Posts and Telecommunications(北京邮电大学)

专题命中 Agent评测 :AI agent(title,abstract);agent(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.18557 2025-09-24 cs.AI 83%

LLMZ+: Contextual Prompt Whitelist Principles for Agentic LLMs

Tom Pawelek, Raj Patel, Charlotte Crowell, Noorbakhsh Amiri, Sudip Mittal, Shahram Rahimi, Andy Perkins

机构 * Department of Computer Science Mississippi State University(计算机科学系密苏里州立大学) Department of Computer Science The University of Alabama(计算机科学系阿拉巴马大学) Mississippi State University, Mississippi State, MS, USA(密苏里州立大学) The University of Alabama, Tuscaloosa, AL, USA(阿拉巴马大学)

专题命中 Agent评测 :agentic(title,abstract);agent(abstract);分类 cs.AI

Comments 7 pages, 5 figures, to be published and presented at ICMLA 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.20148 2025-09-22 cs.AI cs.HC cs.MA 83%

The Anatomy of a Personal Health Agent

A. Ali Heydari, Ken Gu, Vidya Srinivas, Hong Yu, Zhihan Zhang, Yuwei Zhang, Akshay Paruchuri, Qian He, Hamid Palangi, Nova Hammerquist, Ahmed A. Metwally, Brent Winslow, Yubin Kim, Kumar Ayush, Yuzhe Yang, Girish Narayanswamy, Maxwell A. Xu, Jake Garrison, Amy Armento Lee, Jenny Vafeiadou, Ben Graef, Isaac R. Galatzer-Levy, Erik Schenck, Andrew Barakat, Javier Perez, Jacqueline Shreibati, John Hernandez, Anthony Z. Faranesh, Javier L. Prieto, Connor Heneghan, Yun Liu, Jiening Zhan, Mark Malhotra, Shwetak Patel, Tim Althoff, Xin Liu, Daniel McDuff, Xuhai "Orson" Xu

专题命中 Agent评测 :agent(title,abstract);multi-agent(abstract);分类 cs.AI

Comments Minor updates to the manuscript (V2)

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.10875 2025-09-16 cs.AI cond-mat.soft 83%

Is the `Agent' Paradigm a Limiting Framework for Next-Generation Intelligent Systems?

Jesse Gardner, Vladimir A. Baulin

机构 * Active Inference Institute(主动推断研究所)

专题命中 Agent评测 :agent(title,abstract);agentic(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏