arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

AI Agent

智能体、工具调用、规划、工作流、多智能体和自主任务执行。

共收录 15801 信号源:cs.AI, cs.CL, cs.LG, cs.SE

1. Agent评测 15801 篇

2506.01624 2025-06-03 cs.AI cs.LG 84%

Social Cooperation in Conversational AI Agents

Mustafa Mert Çelikok, Saptarashmi Bandyopadhyay, Robert Loftin

机构 * Department of Intelligent Systems(智能系统系) Delft University of Technology(代尔夫特理工大学) Department of Computer Science(计算机科学系) University of Maryland College Park(马里兰大学学院市分校) School of Computer Science(计算机科学学院) University of Sheffield(谢菲尔德大学)

专题命中 Agent评测 :AI agent(title,abstract);agent(abstract);分类 cs.AI、cs.LG

Comments 4 pages, RLDM 2025 abstract (Spotlight presentation)

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.22583 2025-05-29 cs.SE cs.AI 84%

GitGoodBench: A Novel Benchmark For Evaluating Agentic Performance On Git

Tobias Lindenbauer, Egor Bogomolov, Yaroslav Zharov

机构 * JetBrains Research(JetBrains研究院) School of Computation, Information and Technology, Technical University of Munich(技术大学慕尼黑计算、信息与技术学院)

专题命中 Agent评测 :agentic(title);agent(abstract);AI agent(abstract);分类 cs.AI、cs.SE

Comments Short Paper, 5 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.16086 2025-04-30 cs.IR cs.AI cs.CL cs.CV eess.IV 84%

Towards Interpretable Radiology Report Generation via Concept Bottlenecks using a Multi-Agentic RAG

Hasan Md Tusfiqur Alam, Devansh Srivastav, Md Abdul Kadir, Daniel Sonntag

机构 * German Research Center for Artificial Intelligence (DFKI)(德国人工智能研究中心(DFKI)) University of Oldenburg(奥尔登堡大学)

专题命中 Agent评测 :agentic(title);agent(abstract);multi-agent(abstract);分类 cs.AI、cs.CL

Comments Accepted in the 47th European Conference for Information Retrieval (ECIR) 2025

Journal ref Lecture Notes in Computer Science (LNCS) 2025, Volume 15574

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.15850 2025-03-04 cs.CL cs.AI 84%

Forecasting Frontier Language Model Agent Capabilities

Govind Pimpale, Axel Højmark, Jérémy Scheurer, Marius Hobbhahn

专题命中 Agent评测 :agent(title,abstract);autonomous agent(abstract);分类 cs.AI、cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2308.11432 2025-03-04 cs.AI cs.CL 84%

A Survey on Large Language Model based Autonomous Agents

Lei Wang, Chen Ma, Xueyang Feng, Zeyu Zhang, Hao Yang, Jingsen Zhang, Zhiyuan Chen, Jiakai Tang, Xu Chen, Yankai Lin, Wayne Xin Zhao, Zhewei Wei, Ji-Rong Wen

专题命中 Agent评测 :autonomous agent(title,abstract);agent(abstract);分类 cs.AI、cs.CL

Comments Correcting several typos, 35 pages, 5 figures, 3 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.19328 2025-02-27 cs.CL cs.AI 84%

Agentic Reward Modeling: Integrating Human Preferences with Verifiable Correctness Signals for Reliable Reward Systems

Hao Peng, Yunjia Qi, Xiaozhi Wang, Zijun Yao, Bin Xu, Lei Hou, Juanzi Li

专题命中 Agent评测 :agentic(title,abstract);agent(abstract);分类 cs.AI、cs.CL

Comments 16 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.16069 2025-02-27 cs.AI cs.LG 84%

Curie: Toward Rigorous and Automated Scientific Experimentation with AI Agents

Patrick Tser Jern Kon, Jiachen Liu, Qiuyi Ding, Yiming Qiu, Zhenning Yang, Yibo Huang, Jayanth Srinivasa, Myungjin Lee, Mosharaf Chowdhury, Ang Chen

专题命中 Agent评测 :AI agent(title,abstract);agent(abstract);分类 cs.AI、cs.LG

Comments 21 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.14807 2024-10-22 cs.LG cs.AI 84%

Aligning AI Agents via Information-Directed Sampling

Hong Jun Jeon, Benjamin Van Roy

专题命中 Agent评测 :AI agent(title,abstract);agent(abstract);分类 cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.07331 2024-10-14 cs.CL cs.AI 84%

DA-Code: Agent Data Science Code Generation Benchmark for Large Language Models

Yiming Huang, Jianwen Luo, Yan Yu, Yitong Zhang, Fangyu Lei, Yifan Wei, Shizhu He, Lifu Huang, Xiao Liu, Jun Zhao, Kang Liu

专题命中 Agent评测 :agent(title,abstract);planning(abstract);分类 cs.AI、cs.CL

Comments EMNLP 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2409.00899 2024-09-05 cs.SE cs.AI 84%

MarsCode Agent: AI-native Automated Bug Fixing

Yizhou Liu, Pengfei Gao, Xinchen Wang, Jie Liu, Yexuan Shi, Zhao Zhang, Chao Peng

专题命中 Agent评测 :agent(title,abstract);planning(abstract);分类 cs.AI、cs.SE

Comments Yizhou Liu and Pengfei Gao contributed equally and the order is determined by rolling the dice. Chao Peng is the corresponding author

详情

展开后加载摘要…

URL PDF HTML 收藏
2408.11021 2024-08-21 cs.CL cs.AI cs.MA 84%

Athena: Safe Autonomous Agents with Verbal Contrastive Learning

Tanmana Sadhu, Ali Pesaranghader, Yanan Chen, Dong Hoon Yi

专题命中 Agent评测 :autonomous agent(title,abstract);agent(abstract);分类 cs.AI、cs.CL

Comments 9 pages, 2 figures, 4 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2407.01502 2024-07-02 cs.LG cs.AI 84%

AI Agents That Matter

Sayash Kapoor, Benedikt Stroebl, Zachary S. Siegel, Nitya Nadgir, Arvind Narayanan

专题命中 Agent评测 :AI agent(title,abstract);agent(abstract);分类 cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2406.12045 2024-06-19 cs.AI cs.CL 84%

$τ$-bench: A Benchmark for Tool-Agent-User Interaction in Real-World Domains

Shunyu Yao, Noah Shinn, Pedram Razavi, Karthik Narasimhan

专题命中 Agent评测 :agent(title,abstract);function calling(abstract);分类 cs.AI、cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2402.05929 2024-06-18 cs.AI cs.LG cs.RO 84%

An Interactive Agent Foundation Model

Zane Durante, Bidipta Sarkar, Ran Gong, Rohan Taori, Yusuke Noda, Paul Tang, Ehsan Adeli, Shrinidhi Kowshika Lakshmikanth, Kevin Schulman, Arnold Milstein, Demetri Terzopoulos, Ade Famoti, Noboru Kuno, Ashley Llorens, Hoi Vo, Katsu Ikeuchi, Li Fei-Fei, Jianfeng Gao, Naoki Wake, Qiuyuan Huang

专题命中 Agent评测 :agent(title,abstract);AI agent(abstract);分类 cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2403.15729 2024-06-11 cs.CL cs.AI hep-ex physics.ins-det 84%

Towards a RAG-based Summarization Agent for the Electron-Ion Collider

Karthik Suresh, Neeltje Kackar, Luke Schleck, Cristiano Fanelli

专题命中 Agent评测 :agent(title,abstract);workflow(abstract);分类 cs.AI、cs.CL

Comments updated title to have no latex formatting and added acknowledgements

详情

展开后加载摘要…

URL PDF HTML 收藏
2405.13445 2024-05-24 cs.LG cs.AI 84%

Task-agnostic Decision Transformer for Multi-type Agent Control with Federated Split Training

Zhiyuan Wang, Bokui Chen, Xiaoyang Qu, Zhenhou Hong, Jing Xiao, Jianzong Wang

专题命中 Agent评测 :agent(title,abstract);AI agent(abstract);分类 cs.AI、cs.LG

Comments Accepted by the 2024 International Joint Conference on Neural Networks (IJCNN 2024)

详情

展开后加载摘要…

URL PDF HTML 收藏
2310.00092 2023-10-03 cs.CL cs.AI cs.HC 84%

Voice2Action: Language Models as Agent for Efficient Real-Time Interaction in Virtual Reality

Yang Su

专题命中 Agent评测 :agent(title,abstract);autonomous agent(abstract);分类 cs.AI、cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2206.10553 2022-06-22 cs.RO cs.AI cs.LG 84%

Uncertainty Quantification for Competency Assessment of Autonomous Agents

Aastha Acharya, Rebecca Russell, Nisar R. Ahmed

专题命中 Agent评测 :autonomous agent(title,abstract);agent(abstract);分类 cs.AI、cs.LG

Comments Accepted at the Workshop on Safe and Reliable Robot Autonomy under Uncertainty at ICRA 2022, Philadelphia, USA

详情

展开后加载摘要…

URL PDF HTML 收藏
2206.05030 2022-06-13 cs.HC cs.AI cs.LG 84%

Explanation as Question Answering based on a Task Model of the Agent's Design

Ashok Goel, Harshvardhan Sikka, Vrinda Nandan, Jeonghyun Lee, Matt Lisle, Spencer Rugaber

专题命中 Agent评测 :agent(title,abstract);AI agent(abstract);分类 cs.AI、cs.LG

Comments 7 Pages, 10 Figures, IJCAI Explainable AI Workshop

详情

展开后加载摘要…

URL PDF HTML 收藏
2112.13677 2022-04-07 cs.LG cs.AI cs.HC 84%

Agent Smith: Teaching Question Answering to Jill Watson

Ashok Goel, Harshvardhan Sikka, Eric Gregori

专题命中 Agent评测 :agent(title,abstract);AI agent(abstract);分类 cs.AI、cs.LG

Comments 11 Pages, 9 Figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2203.12670 2022-03-25 cs.LG cs.AI cs.HC cs.NE cs.RO 84%

Competency Assessment for Autonomous Agents using Deep Generative Models

Aastha Acharya, Rebecca Russell, Nisar R. Ahmed

专题命中 Agent评测 :autonomous agent(title,abstract);agent(abstract);分类 cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2112.09670 2021-12-20 cs.LG cs.AI cs.RO 84%

An Online Data-Driven Emergency-Response Method for Autonomous Agents in Unforeseen Situations

Glenn Maguire, Nicholas Ketz, Praveen Pilly, Jean-Baptiste Mouret

专题命中 Agent评测 :autonomous agent(title,abstract);agent(abstract);分类 cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2102.12321 2021-07-27 cs.AI cs.CV cs.LG 84%

AGENT: A Benchmark for Core Psychological Reasoning

Tianmin Shu, Abhishek Bhandwaldar, Chuang Gan, Kevin A. Smith, Shari Liu, Dan Gutfreund, Elizabeth Spelke, Joshua B. Tenenbaum, Tomer D. Ullman

专题命中 Agent评测 :agent(title,abstract);planning(abstract);分类 cs.AI、cs.LG

Comments ICML 2021, 12 pages, 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
1504.05811 2020-07-16 cs.RO cs.AI cs.LG 84%

Learning of Behavior Trees for Autonomous Agents

Michele Colledanchise, Ramviyas Parasuraman, Petter Ögren

专题命中 Agent评测 :autonomous agent(title,abstract);agent(abstract);分类 cs.AI、cs.LG

Journal ref IEEE Transactions on Games ( Volume: 11 , Issue: 2 , June 2019 )

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.27453 2026-07-31 cs.AI 新提交 84%

VAmoS Bench: Voice Agent Simulation Bench

VAmoS Bench:语音智能体仿真基准

Joshua Meyer, Sahar Shayegan, Ritiz Tambi, Ali Khan, Sun Kim, Victor Shih, Mehdi Jamei, Andi Partovi

机构 * Veris AI(维瑞斯人工智能公司)

专题命中 Agent评测 :agent(title,abstract);分类 cs.AI

AI总结 该研究推出 VAmoS Bench 语音智能体仿真基准,针对现有基准无法评估语音智能体独立处理电话呼叫能力的空白,在金融服务场景中端到端评估完整语音智能体系统,支持动态排行榜。

Comments 12 pages, 3 figures, 2 tables. Agent implementations: https://github.com/veris-ai/riley-agent

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.09474 2026-07-13 cs.AI 新提交 84%

ProofCouncil: An LLM Agent for Solving Open Mathematical Problems

ProofCouncil:用于解决开放性数学问题的语言模型智能体

Johannes Schmitt, Tim Gehrunger, Jasper Dekoninck, Gergely Bérczi, Uri Kreitner, Liam Price, David Holmes

机构 * ETH Zurich(苏黎世联邦理工学院) Aarhus University(奥胡斯大学) Leiden University(莱顿大学)

专题命中 Agent评测 :agent(title,abstract);agentic(abstract);分类 cs.AI

AI总结 研究旨在提升大型语言模型解决数学开放性问题的性能,介绍了ProofCouncil智能体,它采用作者-评论家架构,在FirstProof挑战及其他问题测试中表现出色,还介绍了其开发及相关构建库并开源。

Comments 25 pages, 7 figures. ProofCouncil appears as System A (IMProofBench ProofCouncil) in the official FirstProof second-batch report (arXiv:2606.18119). Code and agent-building library: https://github.com/eth-sri/proof-council

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.26321 2026-05-27 cs.AI 84%

Anchor: Mitigating Artifact Drift in Agent Benchmark Generation

Anchor:缓解智能体基准生成中的工件漂移

Maksim Ivanov, Abhijay Rana

机构 * Agentic Labs

专题命中 Agent评测 :agent(title,abstract);AI agent(abstract);分类 cs.AI;agentic(comments)

AI总结 提出Anchor管道,通过约束优化程序联合生成指令、环境、真值解和验证器,解决基准生成中的工件漂移问题,并构建ERP-Bench基准评估前沿模型性能。

Comments Accepted to RLEval '26 (Workshop at ACM Conference on AI and Agentic Systems 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.10397 2026-05-12 cs.CV cs.AI 84%

AnomalyClaw: A Universal Visual Anomaly Detection Agent via Tool-Grounded Refutation

AnomalyClaw:通过工具引导的反驳实现通用视觉异常检测代理

Xi Jiang, Yinjie Zhao, Zesheng Yang, Feng Zheng

机构 * Department of Computer Science and Engineering, Southern University of Science and Technology (SUSTech), Shenzhen, China(南方科技大学计算机科学与工程系,深圳,中国) School of EEE, Nanyang Technological University (NTU), Singapore(南洋理工大学电子工程学院,新加坡) CFAR, Agency for Science, Technology and Research (A*STAR), Singapore(科技研究局(A*STAR)的CFAR,新加坡)

专题命中 Agent评测 :agent(title,abstract);agentic(abstract);分类 cs.AI

AI总结 本文提出AnomalyClaw,一种无需训练的视觉异常检测代理,通过多轮反驳过程提升异常判断。在CrossDomainVAD-12基准上,AnomalyClaw在多个模型上均取得显著提升,且引入自演化扩展提升模型性能。

Comments We release the agent, the benchmark, and the analysis artifacts at https://github.com/jam-cc/AnomalyClaw

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.04623 2025-10-07 cs.AI 84%

MedPAO: A Protocol-Driven Agent for Structuring Medical Reports

Shrish Shrinath Vaidya, Gowthamaan Palani, Sidharth Ramesh, Velmurugan Balasubramanian, Minmini Selvam, Gokulraja Srinivasaraja, Ganapathy Krishnamurthi

机构 * Department of Data Science and AI, IIT Madras, India(数据科学与人工智能系,印度理工学院马德拉斯学院) Department of Engineering Design, IIT Madras, India(工程设计系,印度理工学院马德拉斯学院) LoveForm Health Technologies, India(LoveForm健康科技公司,印度) Department of Radiology and Imaging Sciences, Sri Ramachandra Institute of Higher Education and Research, India(放射学与成像科学系, Sri Ramachandra高等教育与研究学院,印度) Department of Neuro and Interventional Radiology, Sri Ramachandra Institute of Higher Education and Research, India(神经放射学与介入放射学系,Sri Ramachandra高等教育与研究学院,印度)

专题命中 Agent评测 :agent(title,abstract);agentic(abstract,comments);分类 cs.AI

Comments Paper published at "Agentic AI for Medicine" Workshop, MICCAI 2025

Journal ref Lecture Notes in Computer Science, vol 16147, 2025. Springer, Cham

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.13311 2025-09-17 cs.CL 84%

Towards General Agentic Intelligence via Environment Scaling

Runnan Fang, Shihao Cai, Baixuan Li, Jialong Wu, Guangyu Li, Wenbiao Yin, Xinyu Wang, Xiaobin Wang, Liangcai Su, Zhen Zhang, Shibin Wu, Zhengwei Tao, Yong Jiang, Pengjun Xie, Fei Huang, Jingren Zhou

机构 * Tongyi Lab(通义实验室) Alibaba Group(阿里巴巴集团)

专题命中 Agent评测 :agentic(title,abstract);agent(abstract,comments);分类 cs.CL

Comments https://tongyi-agent.github.io/blog/introducing-tongyi-deep-research/

详情

展开后加载摘要…

URL PDF HTML 收藏