arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

AI Agent

智能体、工具调用、规划、工作流、多智能体和自主任务执行。

共收录 15819 信号源:cs.AI, cs.CL, cs.LG, cs.SE

1. Agent评测 15819 篇

2502.17812 2026-02-18 cs.CL cs.LG 79%

Can Multimodal LLMs Perform Time Series Anomaly Detection?

多模态大语言模型能否进行时间序列异常检测?

Xiongxiao Xu, Haoran Wang, Yueqing Liang, Philip S. Yu, Yue Zhao, Kai Shu

机构 * Illinois Institute of Technology(伊利诺伊理工学院) Emory University(埃默里大学) University of Illinois Chicago(伊利诺伊大学香槟分校) University of Southern California(南加州大学)

专题命中 Agent评测 :agent(abstract);planning(abstract);multi-agent(abstract);分类 cs.CL、cs.LG

AI总结 本研究提出基于多代理框架的TSAD-Agents,利用多模态大语言模型实现自动时间序列异常检测。

Comments ACM Web Conference 2026 (WWW'26)

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.16443 2026-02-17 cs.LG cs.CL 79%

Endless Terminals: Scaling RL Environments for Terminal Agents

无尽终端:为终端智能体扩展强化学习环境

Kanishk Gandhi, Shivam Garg, Noah D. Goodman, Dimitris Papailiopoulos

机构 * Stanford University(斯坦福大学) Microsoft Research(微软研究院) UW-Madison(威斯康星大学麦迪逊分校)

专题命中 Agent评测 :agent(abstract);agentic(abstract);multi-agent(abstract);分类 cs.CL、cs.LG

AI总结 Endless Terminals 通过自动化生成终端任务并训练智能体,显著提升了在终端基准测试和人工整理基准测试上的性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.05105 2026-02-06 cs.AI cs.RO cs.SE 79%

GAMMS: Graph based Adversarial Multiagent Modeling Simulator

基于图的对抗多智能体建模模拟器

Rohan Patil, Jai Malegaonkar, Xiao Jiang, Andre Dion, Gaurav S. Sukhatme, Henrik I. Christensen

机构 * University of Southern California(美国南加州大学)

专题命中 Agent评测 :agent(abstract);planning(abstract);multi-agent(abstract);分类 cs.AI、cs.SE

AI总结 GAMMS是一款轻量级多智能体仿真框架,支持图结构环境下的快速开发与评估,提供可视化反馈和现实基础,适用于复杂领域如交通和通信系统。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.04197 2026-02-05 cs.CL cs.AI 79%

From Helpfulness to Toxic Proactivity: Diagnosing Behavioral Misalignment in LLM Agents

从有益到有毒的主动性:诊断LLM代理的行为不一致

Xinyue Wang, Yuanhe Zhang, Zhengshuo Gong, Haoran Gao, Fanyu Meng, Zhenhong Zhou, Li Sun, Yang Liu, Sen Su

机构 * Beijing University of Posts(北京邮电大学) China Mobile Research Institute(中国移动研究院) Nanyang Technological University(南洋理工大学)

专题命中 Agent评测 :agent(abstract);tool-use(abstract);planning(abstract);分类 cs.AI、cs.CL

AI总结 本文研究了LLM代理在权衡有益与无害时产生的有毒主动性行为,提出了一种基于双模型互动的评估框架,并通过实验揭示了该现象的普遍性及两种主要趋势。

Comments 9 pages (excluding appendices), 6 figures. Code is available at https://github.com/wxyoio-0715/Toxic-Proactivity

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.17173 2026-01-27 cs.CL cs.AI 79%

Beyond Factual QA: Mentorship-Oriented Question Answering over Long-Form Multilingual Content

超越事实问答:面向长形式多语言内容的指导型问答

Parth Bhalerao, Diola Dsouza, Ruiwen Guan, Oana Ignat

专题命中 Agent评测 :agent(abstract);agentic(abstract);multi-agent(abstract);分类 cs.AI、cs.CL

AI总结 本文提出MentorQA,首个多语言长形式视频指导型问答数据集和评估框架,通过对比不同架构发现Multi-Agent在复杂和低资源语言中表现更优。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.09108 2025-12-11 cs.SE cs.AI 79%

Evolving Excellence: Automated Optimization of LLM-based Agents

精益求精:基于大语言模型的代理的自动化优化

Paul Brookes, Vardan Voskanyan, Rafail Giavrimis, Matthew Truscott, Mina Ilieva, Chrystalla Pavlou, Alexandru Staicu, Manal Adham, Will Evers- Hood, Jingzhi Gong, Kejia Zhang, Matvey Fedoseev, Vishal Sharma, Roman Bauer, Zheng Wang, Hema Nair, Wei Jie, Tianhua Xu, Aurora Constantin, Leslie Kanthan, Michail Basios

机构 * University of Leeds(利兹大学) City, University of London(伦敦城市大学) University of West London(西伦敦大学) University of Edinburgh(爱丁堡大学) University of Surrey(萨里大学) University of Warwick(沃里克大学) King's College London(伦敦国王学院)

专题命中 Agent评测 :agent(abstract);AI agent(abstract);agentic(abstract);分类 cs.AI、cs.SE

AI总结 ARTEMIS通过语义感知的进化算法,自动优化基于大语言模型的代理配置,显著提升多个任务的性能表现。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.23397 2025-12-01 cs.CL cs.AI cs.MA 79%

MegaChat: A Synthetic Persian Q&A Dataset for High-Quality Sales Chatbot Evaluation

MegaChat: 一个用于高质量销售聊天机器人评估的合成波斯语问答数据集

Mahdi Rahmani, AmirHossein Saffari, Reyhane Rahmani

专题命中 Agent评测 :agent(abstract);agentic(abstract);multi-agent(abstract);分类 cs.AI、cs.CL

AI总结 MegaChat通过自动化多代理架构生成高质量波斯语问答数据,用于评估销售聊天机器人,优于传统RAG模型。

Comments 6 pages, 11 figures, 2 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.13835 2025-10-17 cs.CL cs.AI 79%

ConDABench: Interactive Evaluation of Language Models for Data Analysis

Avik Dutta, Priyanshu Gupta, Hosein Hasanbeig, Rahul Pratap Singh, Harshit Nigam, Sumit Gulwani, Arjun Radhakrishna, Gustavo Soares, Ashish Tiwari

机构 * Microsoft(微软)

专题命中 Agent评测 :agent(abstract);workflow(abstract);multi-agent(abstract);分类 cs.AI、cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2403.16843 2025-10-16 cs.LG cs.AI cs.GT 79%

Do LLM Agents Have Regret? A Case Study in Online Learning and Games

Chanwoo Park, Xiangyu Liu, Asuman Ozdaglar, Kaiqing Zhang

机构 * Massachusetts Institute of Technology(麻省理工学院) University of Maryland, College Park(马里兰大学College Park分校)

专题命中 Agent评测 :agent(abstract);autonomous agent(abstract);multi-agent(abstract);分类 cs.AI、cs.LG

Comments Camera ready version of ICLR 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.18658 2025-09-09 cs.HC cs.AI cs.SE 79%

Assistance or Disruption? Exploring and Evaluating the Design and Trade-offs of Proactive AI Programming Support

Kevin Pu, Daniel Lazaro, Ian Arawjo, Haijun Xia, Ziang Xiao, Tovi Grossman, Yan Chen

机构 * University of Toronto(多伦多大学) University of California San Diego(加州大学圣地亚哥分校) Johns Hopkins University(约翰霍普金斯大学)

专题命中 Agent评测 :agent(abstract);AI agent(abstract);workflow(abstract);分类 cs.AI、cs.SE

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.15310 2025-08-22 cs.CR cs.AI cs.CL 79%

IPIGuard: A Novel Tool Dependency Graph-Based Defense Against Indirect Prompt Injection in LLM Agents

Hengyu An, Jinghuai Zhang, Tianyu Du, Chunyi Zhou, Qingming Li, Tao Lin, Shouling Ji

专题命中 Agent评测 :agent(abstract);planning(abstract);agentic(abstract);分类 cs.AI、cs.CL

Comments EMNLP 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.23701 2025-08-15 cs.AI cs.CL 79%

TextQuests: How Good are LLMs at Text-Based Video Games?

Long Phan, Mantas Mazeika, Andy Zou, Dan Hendrycks

机构 * Center for AI Safety(人工智能安全中心) Carnegie Mellon University(卡内基梅隆大学) Gray Swan AI(灰天鹅AI)

专题命中 Agent评测 :agent(abstract);AI agent(abstract);tool use(abstract);分类 cs.AI、cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.22673 2025-07-18 cs.AI cs.CL 79%

ActionStudio: A Lightweight Framework for Data and Training of Large Action Models

Jianguo Zhang, Thai Hoang, Ming Zhu, Zuxin Liu, Shiyu Wang, Tulika Awalgaonkar, Akshara Prabhakar, Haolin Chen, Weiran Yao, Zhiwei Liu, Juntao Tan, Juan Carlos Niebles, Shelby Heinecke, Huan Wang, Silvio Savarese, Caiming Xiong

专题命中 Agent评测 :agent(abstract);autonomous agent(abstract);agentic(abstract);分类 cs.AI、cs.CL

Comments 16 pages; large action models; xLAM; ActionStudio

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.00406 2025-07-09 cs.AI cs.CL 79%

Agents Are All You Need for LLM Unlearning

Debdeep Sanyal, Murari Mandal

机构 * RespAI Lab, School of Computer Engineering, KIIT Bhubaneswar(RespAI实验室,计算机工程学院,KIIT大学)

专题命中 Agent评测 :agent(abstract);agentic(abstract);multi-agent(abstract);分类 cs.AI、cs.CL

Comments Accepted to COLM 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.08403 2025-06-12 cs.CL cs.AI 79%

TACTIC: Translation Agents with Cognitive-Theoretic Interactive Collaboration

Weiya Li, Junjie Chen, Bei Li, Boyang Liu, Zichen Wen, Nuanqiao Shan, Xiaoqian Liu, Anping Liu, Huajie Liu, Hu Song, Linfeng Zhang

机构 * Big Data&AI Lab, ICBC(大数据与人工智能实验室,ICBC) Shanghai Jiao Tong University(上海交通大学) Meituan Inc.(美团公司) Tongji University(同济大学) Fudan University(复旦大学) Northeastern University(东北大学)

专题命中 Agent评测 :agent(abstract);workflow(abstract);multi-agent(abstract);分类 cs.AI、cs.CL

Comments 20 pages, 4 figures, Under review. Code: https://github.com/weiyali126/TACTIC

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.18878 2025-05-27 cs.CL cs.AI 79%

CRMArena-Pro: Holistic Assessment of LLM Agents Across Diverse Business Scenarios and Interactions

Kung-Hsiang Huang, Akshara Prabhakar, Onkar Thorat, Divyansh Agarwal, Prafulla Kumar Choubey, Yixin Mao, Silvio Savarese, Caiming Xiong, Chien-Sheng Wu

机构 * Salesforce AI Research(Salesforce人工智能研究)

专题命中 Agent评测 :agent(abstract);AI agent(abstract);workflow(abstract);分类 cs.AI、cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.19400 2025-05-27 cs.AI cs.CL cs.CV cs.MM 79%

TheoremExplainAgent: Towards Video-based Multimodal Explanations for LLM Theorem Understanding

Max Ku, Thomas Chong, Jonathan Leung, Krish Shah, Alvin Yu, Wenhu Chen

机构 * University of Waterloo(滑铁卢大学) Votee AI Vector Institute(向量研究所)

专题命中 Agent评测 :agent(abstract);planning(abstract);agentic(abstract);分类 cs.AI、cs.CL

Comments accepted to ACL 2025 main, camera ready

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.13291 2025-05-20 cs.LG cs.AI 79%

TimeSeriesGym: A Scalable Benchmark for (Time Series) Machine Learning Engineering Agents

Yifu Cai, Xinyu Li, Mononito Goswami, Michał Wiliński, Gus Welter, Artur Dubrawski

专题命中 Agent评测 :agent(abstract);AI agent(abstract);agentic(abstract);分类 cs.AI、cs.LG

Comments Open source code available at https://github.com/moment-timeseries-foundation-model/TimeSeriesGym. YC, XL, MG and MW contributed equally, and should be considered joint first authors

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.02254 2025-04-04 cs.CL cs.AI 79%

LLMs as Deceptive Agents: How Role-Based Prompting Induces Semantic Ambiguity in Puzzle Tasks

Seunghyun Yoo

专题命中 Agent评测 :agent(abstract);autonomous agent(abstract);agentic(abstract);分类 cs.AI、cs.CL

Comments 9 pages, 5 figures, 1 table

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.11613 2025-02-25 cs.CL cs.AI cs.ET cs.HC cs.PL 79%

Conversation Routines: A Prompt Engineering Framework for Task-Oriented Dialog Systems

Giorgio Robino

专题命中 Agent评测 :agent(abstract);agentic(abstract);multi-agent(abstract);分类 cs.AI、cs.CL

Comments Minor typos revision

详情

展开后加载摘要…

URL PDF HTML 收藏
2406.05590 2025-02-19 cs.CR cs.AI cs.CY cs.LG 79%

NYU CTF Bench: A Scalable Open-Source Benchmark Dataset for Evaluating LLMs in Offensive Security

Minghao Shao, Sofija Jancheska, Meet Udeshi, Brendan Dolan-Gavitt, Haoran Xi, Kimberly Milner, Boyuan Chen, Max Yin, Siddharth Garg, Prashanth Krishnamurthy, Farshad Khorrami, Ramesh Karri, Muhammad Shafique

专题命中 Agent评测 :planning(abstract);workflow(abstract);function calling(abstract);分类 cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2408.00170 2025-01-03 cs.HC cs.AI cs.LG 79%

CREW: Facilitating Human-AI Teaming Research

Lingyu Zhang, Zhengran Ji, Boyuan Chen

专题命中 Agent评测 :agent(abstract);AI agent(abstract);multi-agent(abstract);分类 cs.AI、cs.LG

Comments Our project website is at: http://generalroboticslab.com/CREW

详情

展开后加载摘要…

URL PDF HTML 收藏
2403.02959 2024-09-24 cs.CL cs.AI 79%

AgentsCourt: Building Judicial Decision-Making Agents with Court Debate Simulation and Legal Knowledge Augmentation

Zhitao He, Pengfei Cao, Chenhao Wang, Zhuoran Jin, Yubo Chen, Jiexin Xu, Huaijun Li, Xiaojian Jiang, Kang Liu, Jun Zhao

专题命中 Agent评测 :agent(abstract);autonomous agent(abstract);multi-agent(abstract);分类 cs.AI、cs.CL

Comments Accepted by EMNLP 2024 Findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2404.05337 2024-04-09 cs.CL cs.AI 79%

Towards Objectively Benchmarking Social Intelligence for Language Agents at Action Level

Chenxu Wang, Bin Dai, Huaping Liu, Baoyuan Wang

专题命中 Agent评测 :agent(abstract);planning(abstract);multi-agent(abstract);分类 cs.AI、cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2308.03526 2023-08-08 cs.LG cs.AI 79%

AlphaStar Unplugged: Large-Scale Offline Reinforcement Learning

Michaël Mathieu, Sherjil Ozair, Srivatsan Srinivasan, Caglar Gulcehre, Shangtong Zhang, Ray Jiang, Tom Le Paine, Richard Powell, Konrad Żołna, Julian Schrittwieser, David Choi, Petko Georgiev, Daniel Toyama, Aja Huang, Roman Ring, Igor Babuschkin, Timo Ewalds, Mahyar Bordbar, Sarah Henderson, Sergio Gómez Colmenarejo, Aäron van den Oord, Wojciech Marian Czarnecki, Nando de Freitas, Oriol Vinyals

专题命中 Agent评测 :agent(abstract);planning(abstract);multi-agent(abstract);分类 cs.AI、cs.LG

Comments 32 pages, 13 figures, previous version published as a NeurIPS 2021 workshop: https://openreview.net/forum?id=Np8Pumfoty

详情

展开后加载摘要…

URL PDF HTML 收藏
2201.12658 2023-06-07 cs.LG cs.AI cs.MA 79%

Learning Intuitive Policies Using Action Features

Mingwei Ma, Jizhou Liu, Samuel Sokota, Max Kleiman-Weiner, Jakob Foerster

专题命中 Agent评测 :agent(abstract);AI agent(abstract);multi-agent(abstract);分类 cs.AI、cs.LG

Comments ICML 2023

详情

展开后加载摘要…

URL PDF HTML 收藏
2206.10944 2022-06-23 cs.LG cs.AI cs.MA 79%

POGEMA: Partially Observable Grid Environment for Multiple Agents

Alexey Skrynnik, Anton Andreychuk, Konstantin Yakovlev, Aleksandr I. Panov

专题命中 Agent评测 :agent(abstract);planning(abstract);multi-agent(abstract);分类 cs.AI、cs.LG

Comments 7 pages, 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2107.12808 2021-08-03 cs.LG cs.AI cs.MA 79%

Open-Ended Learning Leads to Generally Capable Agents

Open Ended Learning Team, Adam Stooke, Anuj Mahajan, Catarina Barros, Charlie Deck, Jakob Bauer, Jakub Sygnowski, Maja Trebacz, Max Jaderberg, Michael Mathieu, Nat McAleese, Nathalie Bradley-Schmieg, Nathaniel Wong, Nicolas Porcel, Roberta Raileanu, Steph Hughes-Fitt, Valentin Dalibard, Wojciech Marian Czarnecki

专题命中 Agent评测 :agent(abstract);tool use(abstract);multi-agent(abstract);分类 cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2006.02636 2020-06-05 cs.CV cs.AI cs.LG cs.RO stat.ML 79%

The Importance of Prior Knowledge in Precise Multimodal Prediction

Sergio Casas, Cole Gulino, Simon Suo, Raquel Urtasun

专题命中 Agent评测 :agent(abstract);planning(abstract);multi-agent(abstract);分类 cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
1904.05759 2019-04-12 cs.LG cs.AI cs.MA 79%

Safer Deep RL with Shallow MCTS: A Case Study in Pommerman

Bilal Kartal, Pablo Hernandez-Leal, Chao Gao, Matthew E. Taylor

专题命中 Agent评测 :agent(abstract);planning(abstract);multi-agent(abstract);分类 cs.AI、cs.LG

Comments Adaptive Learning Agents (ALA) Workshop at AAMAS 2019. arXiv admin note: substantial text overlap with arXiv:1812.00045

详情

展开后加载摘要…

URL PDF HTML 收藏