arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

AI Agent

智能体、工具调用、规划、工作流、多智能体和自主任务执行。

共收录 15756 信号源:cs.AI, cs.CL, cs.LG, cs.SE

1. Agent评测 15756 篇

2505.22531 2025-06-16 cs.LG cs.AI cs.CR 73%

Training RL Agents for Multi-Objective Network Defense Tasks

Andres Molina-Markham, Luis Robaina, Sean Steinle, Akash Trivedi, Derek Tsui, Nicholas Potteiger, Lauren Brandt, Ransom Winder, Ahmad Ridley

机构 * The MITRE Corporation(MITRE公司) NSA(国家安全局)

专题命中 Agent评测 :agent(abstract);autonomous agent(abstract);分类 cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2312.04540 2025-06-12 cs.LG cs.AI cs.CV cs.MA cs.RO 73%

Sim-to-Real Causal Transfer: A Metric Learning Approach to Causally-Aware Interaction Representations

Ahmad Rahimi, Po-Chien Luan, Yuejiang Liu, Frano Rajič, Alexandre Alahi

机构 * École Polytechnique Fédérale de Lausanne(瑞士联邦理工学院) Stanford University(斯坦福大学) ETH Zurich(苏黎世联邦理工学院)

专题命中 Agent评测 :agent(abstract);multi-agent(abstract);分类 cs.AI、cs.LG

Comments CVPR 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.09160 2025-06-11 cs.AI cs.LG cs.RO 73%

Innate-Values-driven Reinforcement Learning based Cognitive Modeling

Qin Yang

机构 * Intelligent Social Systems and Swarm Robotics Lab (IS$^3$R)(智能社会系统与群体机器人实验室) Computer Science and Information Systems Department(计算机科学与信息系统系) Bradley University(布拉德利大学)

专题命中 Agent评测 :agent(abstract);AI agent(abstract);分类 cs.AI、cs.LG

Comments The paper had been accepted by the 2025 IEEE Conference on Cognitive and Computational Aspects of Situation Management (CogSIMA). arXiv admin note: text overlap with arXiv:2401.05572

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.07982 2025-06-10 cs.AI cs.CL 73%

$τ^2$-Bench: Evaluating Conversational Agents in a Dual-Control Environment

Victor Barres, Honghua Dong, Soham Ray, Xujie Si, Karthik Narasimhan

专题命中 Agent评测 :agent(abstract);AI agent(abstract);分类 cs.AI、cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.06020 2025-06-09 cs.CL cs.AI 73%

When to Trust Context: Self-Reflective Debates for Context Reliability

Zeqi Zhou, Fang Wu, Shayan Talaei, Haokai Zhao, Cheng Meixin, Tinson Xu, Amin Saberi, Yejin Choi

机构 * Brown University(布朗大学) Stanford University(斯坦福大学) University of New South Wales(新南威尔士大学) Xi’an University of Electronic Science and Technology(西安电子科技大学) University of Chicago(芝加哥大学)

专题命中 Agent评测 :agent(abstract);multi-agent(abstract);分类 cs.AI、cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.17767 2025-06-09 cs.CL cs.LG 73%

ResearchTown: Simulator of Human Research Community

Haofei Yu, Zhaochen Hong, Zirui Cheng, Kunlun Zhu, Keyang Xuan, Jinwei Yao, Tao Feng, Jiaxuan You

机构 * Haofei Yu Zhaochen Hong Zirui Cheng Kunlun Zhu Keyang Xuan Jinwei Yao Tao Feng Jiaxuan You

专题命中 Agent评测 :agent(abstract);multi-agent(abstract);分类 cs.CL、cs.LG

Comments 9 pages, ICML 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.05431 2025-06-09 cs.CV cs.AI cs.LG 73%

Robustness Evaluation for Video Models with Reinforcement Learning

Ashwin Ramesh Babu, Sajad Mousavi, Vineet Gundecha, Sahand Ghorbanpour, Avisek Naug, Antonio Guillen, Ricardo Luna Gutierrez, Soumyendu Sarkar

专题命中 Agent评测 :agent(abstract);multi-agent(abstract);分类 cs.AI、cs.LG

Comments Accepted at the IEEE/CVF Conference on Computer Vision and Pattern Recognition Workshops (CVPRW) 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.09560 2025-06-06 cs.AI cs.CL cs.CV 73%

EmbodiedBench: Comprehensive Benchmarking Multi-modal Large Language Models for Vision-Driven Embodied Agents

Rui Yang, Hanyang Chen, Junyu Zhang, Mark Zhao, Cheng Qian, Kangrui Wang, Qineng Wang, Teja Venkat Koripella, Marziyeh Movahedi, Manling Li, Heng Ji, Huan Zhang, Tong Zhang

专题命中 Agent评测 :agent(abstract);planning(abstract);分类 cs.AI、cs.CL

Comments Accepted to ICML 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.01716 2025-06-03 cs.AI cs.CL 73%

Self-Challenging Language Model Agents

Yifei Zhou, Sergey Levine, Jason Weston, Xian Li, Sainbayar Sukhbaatar

机构 * UC Berkeley(伯克利大学) FAIR at Meta(Meta 公司人工智能研究部)

专题命中 Agent评测 :agent(abstract);tool-use(abstract);分类 cs.AI、cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.23852 2025-06-02 cs.CL cs.AI cs.MA stat.AP 73%

Large Language Model-Based Agents for Automated Research Reproducibility: An Exploratory Study in Alzheimer's Disease

Nic Dobbins, Christelle Xiong, Kristine Lan, Meliha Yetisgen

机构 * Biomedical Informatics & Data Science, Johns Hopkins University(约翰霍普金斯大学生物医学信息学与数据科学) Biomedical & Health Informatics, University of Washington(华盛顿大学生物医学与健康信息学)

专题命中 Agent评测 :agent(abstract);autonomous agent(abstract);分类 cs.AI、cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.20732 2025-05-28 cs.CL cs.LG 73%

SPA-RL: Reinforcing LLM Agents via Stepwise Progress Attribution

Hanlin Wang, Chak Tou Leong, Jiashuo Wang, Jian Wang, Wenjie Li

机构 * Department of Computing, The Hong Kong Polytechnic University(计算机学系,香港理工大学)

专题命中 Agent评测 :agent(abstract);agentic(abstract);分类 cs.CL、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.15114 2025-05-28 cs.LG cs.AI 73%

RE-Bench: Evaluating frontier AI R&D capabilities of language model agents against human experts

Hjalmar Wijk, Tao Lin, Joel Becker, Sami Jawhar, Neev Parikh, Thomas Broadley, Lawrence Chan, Michael Chen, Josh Clymer, Jai Dhyani, Elena Ericheva, Katharyn Garcia, Brian Goodrich, Nikola Jurkovic, Holden Karnofsky, Megan Kinniment, Aron Lajko, Seraphina Nix, Lucas Sato, William Saunders, Maksym Taran, Ben West, Elizabeth Barnes

机构 * METR AI R&D Evaluation(METR AI R&D评估)

专题命中 Agent评测 :agent(abstract);AI agent(abstract);分类 cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.13311 2025-05-27 cs.CL cs.AI 73%

Training Turn-by-Turn Verifiers for Dialogue Tutoring Agents: The Curious Case of LLMs as Your Coding Tutors

Jian Wang, Yinpei Dai, Yichi Zhang, Ziqiao Ma, Wenjie Li, Joyce Chai

机构 * The Hong Kong Polytechnic University(香港理工大学) University of Michigan(密歇根大学)

专题命中 Agent评测 :agent(abstract);workflow(abstract);分类 cs.AI、cs.CL

Comments Accepted to Findings of ACL 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2406.06051 2025-05-21 cs.AI cs.HC cs.LG 73%

On the Utility of Accounting for Human Beliefs about AI Intention in Human-AI Collaboration

Guanghui Yu, Robert Kasumba, Chien-Ju Ho, William Yeoh

机构 * Washington University in St. Louis(圣路易斯华盛顿大学)

专题命中 Agent评测 :agent(abstract);AI agent(abstract);分类 cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.09595 2025-05-15 cs.CL cs.AI cs.CY cs.MA 73%

WorldView-Bench: A Benchmark for Evaluating Global Cultural Perspectives in Large Language Models

Abdullah Mushtaq, Imran Taj, Rafay Naeem, Ibrahim Ghaznavi, Junaid Qadir

机构 * Information Technology University Department of Computer Science(信息科技大学计算机科学系) Zayed University College of Interdisciplinary Studies(扎耶德大学跨学科研究学院) Computer Science and Engineering Department(计算机科学与工程系)

专题命中 Agent评测 :agent(abstract);multi-agent(abstract);分类 cs.AI、cs.CL

Comments Preprint. Submitted to the Journal of Artificial Intelligence Research (JAIR) on April 29, 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.08120 2025-05-14 cs.CL cs.LG 73%

Putting It All into Context: Simplifying Agents with LCLMs

Mingjian Jiang, Yangjun Ruan, Luis Lastras, Pavan Kapanipathi, Tatsunori Hashimoto

机构 * Stanford University(斯坦福大学) IBM Research(IBM研究院) University of Toronto(多伦多大学)

专题命中 Agent评测 :agent(abstract);agentic(abstract);分类 cs.CL、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.01639 2025-05-13 cs.LG cs.AI cs.CY 73%

Moral Alignment for LLM Agents

Elizaveta Tennant, Stephen Hailes, Mirco Musolesi

机构 * University College London(伦敦大学学院) University of Bologna(博洛尼亚大学)

专题命中 Agent评测 :agent(abstract);agentic(abstract);分类 cs.AI、cs.LG

Comments Published at the 13th International Conference on Learning Representations (ICLR'25), Singapore, Apr 2025. https://openreview.net/forum?id=MeGDmZjUXy

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.02709 2025-05-06 cs.AI cs.LG 73%

Technical Report: Evaluating Goal Drift in Language Model Agents

Rauno Arike, Elizabeth Donoway, Henning Bartsch, Marius Hobbhahn

专题命中 Agent评测 :agent(abstract);autonomous agent(abstract);分类 cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.06172 2025-04-24 cs.AI cs.CL 73%

Multimodal Situational Safety

Kaiwen Zhou, Chengzhi Liu, Xuandong Zhao, Anderson Compalas, Dawn Song, Xin Eric Wang

机构 * University of California, Santa Cruz(加州大学圣克ruz分校) University of California, Berkeley(加州大学伯克利分校)

专题命中 Agent评测 :agent(abstract);multi-agent(abstract);分类 cs.AI、cs.CL

Comments ICLR 2025 Camera Ready

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.12321 2025-04-18 cs.CL cs.AI 73%

AttentionDefense: Leveraging System Prompt Attention for Explainable Defense Against Novel Jailbreaks

Charlotte Siska, Anush Sankaran

专题命中 Agent评测 :agent(abstract);multi-agent(abstract);分类 cs.AI、cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.01848 2025-04-08 cs.AI cs.CL 73%

PaperBench: Evaluating AI's Ability to Replicate AI Research

Giulio Starace, Oliver Jaffe, Dane Sherburn, James Aung, Jun Shern Chan, Leon Maksin, Rachel Dias, Evan Mays, Benjamin Kinsella, Wyatt Thompson, Johannes Heidecke, Amelia Glaese, Tejal Patwardhan

专题命中 Agent评测 :agent(abstract);AI agent(abstract);分类 cs.AI、cs.CL

Comments 30 pages, 14 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.00599 2025-03-26 cs.CV cs.AI cs.LG 73%

VideoRefer Suite: Advancing Spatial-Temporal Object Understanding with Video LLM

Yuqian Yuan, Hang Zhang, Wentong Li, Zesen Cheng, Boqiang Zhang, Long Li, Xin Li, Deli Zhao, Wenqiao Zhang, Yueting Zhuang, Jianke Zhu, Lidong Bing

专题命中 Agent评测 :agent(abstract);multi-agent(abstract);分类 cs.AI、cs.LG

Comments 17 pages, 14 figures, technical report

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.11355 2025-03-25 cs.CL cs.AI cs.CR cs.CY 73%

Nuclear Deployed: Analyzing Catastrophic Risks in Decision-making of Autonomous LLM Agents

Rongwu Xu, Xiaojian Li, Shuo Chen, Wei Xu

专题命中 Agent评测 :agent(abstract);agentic(abstract);分类 cs.AI、cs.CL

Comments Please visit https://llm-catastrophic-risks.github.io for a quick tour of our research. Our code is available at https://github.com/pillowsofwind/LLM-CBRN-Risks

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.20963 2025-03-19 cs.LG cs.AI econ.GN q-fin.EC 73%

Retrieval Augmented Generation for Topic Modeling in Organizational Research: An Introduction with Empirical Demonstration

Gerion Spielberger, Florian M. Artinger, Jochen Reb, Rudolf Kerschreiter

专题命中 Agent评测 :agent(abstract);agentic(abstract);分类 cs.AI、cs.LG

Comments 30 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.13178 2025-03-18 cs.AI cs.LG 73%

Rapfi: Distilling Efficient Neural Network for the Game of Gomoku

Zhanggen Jin, Haobin Duan, Zhiyang Hang

专题命中 Agent评测 :agent(abstract);AI agent(abstract);分类 cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.07860 2025-03-12 cs.CV cs.AI cs.LG 73%

Video Action Differencing

James Burgess, Xiaohan Wang, Yuhui Zhang, Anita Rau, Alejandro Lozano, Lisa Dunlap, Trevor Darrell, Serena Yeung-Levy

专题命中 Agent评测 :workflow(abstract);agentic(abstract);分类 cs.AI、cs.LG

Comments ICLR 2025 (International Conference on Learning Representations) Project page: http://jmhb0.github.io/viddiff Benchmark: https://huggingface.co/datasets/jmhb/VidDiffBench

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.19652 2025-02-28 cs.LG cs.AI cs.RO 73%

Robust Gymnasium: A Unified Modular Benchmark for Robust Reinforcement Learning

Shangding Gu, Laixi Shi, Muning Wen, Ming Jin, Eric Mazumdar, Yuejie Chi, Adam Wierman, Costas Spanos

专题命中 Agent评测 :agent(abstract);multi-agent(abstract);分类 cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.16796 2025-02-25 cs.MA cs.AI cs.CL cs.HC 73%

MobileSteward: Integrating Multiple App-Oriented Agents with Self-Evolution to Automate Cross-App Instructions

Yuxuan Liu, Hongda Sun, Wei Liu, Jian Luan, Bo Du, Rui Yan

专题命中 Agent评测 :agent(abstract);multi-agent(abstract);分类 cs.AI、cs.CL

Comments Accepted by KDD2025 Research Track

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.13092 2025-02-25 cs.CL cs.AI 73%

Text2World: Benchmarking Large Language Models for Symbolic World Model Generation

Mengkang Hu, Tianxing Chen, Yude Zou, Yuheng Lei, Qiguang Chen, Ming Li, Yao Mu, Hongyuan Zhang, Wenqi Shao, Ping Luo

专题命中 Agent评测 :agent(abstract);planning(abstract);分类 cs.AI、cs.CL

Comments Project page: https://text-to-world.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.18444 2025-02-19 cs.CL cs.AI 73%

Is my Meeting Summary Good? Estimating Quality with a Multi-LLM Evaluator

Frederic Kirstein, Terry Ruas, Bela Gipp

专题命中 Agent评测 :agent(abstract);multi-agent(abstract);分类 cs.AI、cs.CL

Journal ref COLING 2025 Industry Track

详情

展开后加载摘要…

URL PDF HTML 收藏