arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

AI Agent

智能体、工具调用、规划、工作流、多智能体和自主任务执行。

共收录 15866 信号源:cs.AI, cs.CL, cs.LG, cs.SE

1. Agent评测 15866 篇

2502.15538 2025-05-30 cs.CL cs.CY cs.HC 57%

SOTOPIA-$Ω$: Dynamic Strategy Injection Learning and Social Instruction Following Evaluation for Social Agents

Wenyuan Zhang, Tianyun Liu, Mengxiao Song, Xiaodong Li, Tingwen Liu

专题命中 Agent评测 :agent(abstract);分类 cs.CL

Comments Accepted by ACL 2025 (Main Conference)

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.18411 2025-05-30 cs.AI astro-ph.IM physics.comp-ph 57%

Gravity-Bench-v1: A Benchmark on Gravitational Physics Discovery for Agents

Nolan Koblischke, Hyunseok Jang, Kristen Menou, Mohamad Ali-Dib

机构 * University of Toronto(多伦多大学) New York University Abu Dhabi(纽约大学阿布扎克分校)

专题命中 Agent评测 :AI agent(abstract);分类 cs.AI

Comments Accepted at ICML 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.22174 2025-05-29 cs.GT cs.AI cs.MA 57%

Online Fair Division for Personalized $2$-Value Instances

Georgios Amanatidis, Alexandros Lolos, Evangelos Markakis, Victor Turmel

专题命中 Agent评测 :agent(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.20642 2025-05-28 cs.AI 57%

CoderAgent: Simulating Student Behavior for Personalized Programming Learning with Large Language Models

Yi Zhan, Qi Liu, Weibo Gao, Zheng Zhang, Tianfu Wang, Shuanghong Shen, Junyu Lu, Zhenya Huang

机构 * State Key Laboratory of Cognitive Intelligence, University of Science and Technology of China(认知智能国家重点实验室,中国科学技术大学) Institute of Artificial Intelligence, Hefei Comprehensive National Science Center(人工智能研究院,合肥综合性国家科学中心)

专题命中 Agent评测 :agent(abstract);分类 cs.AI

Comments Accepted by IJCAI2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.14427 2025-05-28 cs.AI 57%

VisEscape: A Benchmark for Evaluating Exploration-driven Decision-making in Virtual Escape Rooms

Seungwon Lim, Sungwoong Kim, Jihwan Yu, Sungjae Lee, Jiwan Chung, Youngjae Yu

机构 * ACL Proceedings(ACL会议)

专题命中 Agent评测 :planning(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2406.07275 2025-05-28 cs.AI 57%

DCA-Bench: A Benchmark for Dataset Curation Agents

Benhao Huang, Yingzhuo Yu, Jin Huang, Xingjian Zhang, Jiaqi Ma

机构 * Carnegie Mellon University(卡内基梅隆大学) University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) University of Michigan - Ann Arbor(密歇根大学安娜堡分校)

专题命中 Agent评测 :agent(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.19376 2025-05-27 cs.CL 57%

Belief Attribution as Mental Explanation: The Role of Accuracy, Informativity, and Causality

Lance Ying, Almog Hillel, Ryan Truong, Vikash K. Mansinghka, Joshua B. Tenenbaum, Tan Zhi-Xuan

机构 * Massachusetts Institute of Technology(麻省理工学院) Harvard University(哈佛大学)

专题命中 Agent评测 :agent(abstract);分类 cs.CL

Comments 8 pages, 3 figures; oral presentation at CogSci 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.18858 2025-05-27 cs.RO cs.LG 57%

Guided by Guardrails: Control Barrier Functions as Safety Instructors for Robotic Learning

Maeva Guerrier, Karthik Soma, Hassan Fouad, Giovanni Beltrame

机构 * Department of Computer Engineering and Software Engineering, Polytechnique Montreal(计算机工程与软件工程系,蒙特利尔大学) Mila - Quebec AI Institute(魁北克人工智能研究所)

专题命中 Agent评测 :agent(abstract);分类 cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.18543 2025-05-27 cs.CR cs.IR cs.LG 57%

Benchmarking Poisoning Attacks against Retrieval-Augmented Generation

Baolei Zhang, Haoran Xin, Jiatong Li, Dongzhe Zhang, Minghong Fang, Zhuqing Liu, Lihai Nie, Zheli Liu

机构 * Nankai University(南开大学) University of Louisville(路易斯安那大学) University of North Texas(北卡罗来纳州立大学)

专题命中 Agent评测 :agent(abstract);分类 cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.12904 2025-05-27 cs.CL 57%

Fraud-R1 : A Multi-Round Benchmark for Assessing the Robustness of LLM Against Augmented Fraud and Phishing Inducements

Shu Yang, Shenzhe Zhu, Zeyu Wu, Keyu Wang, Junchi Yao, Junchao Wu, Lijie Hu, Mengdi Li, Derek F. Wong, Di Wang

机构 * Provable Responsible AI and Data Analytics (PRADA) Lab(可证责任AI与数据分析实验室) King Abdullah University of Science and Technology(卡瓦尔大学科学与技术大学) University of Toronto(多伦多大学) University of Macau(澳门大学) University of Electronic Science and Technology of China(电子科技大学)

专题命中 Agent评测 :agent(abstract);分类 cs.CL

Comments Accepted by ACL2025 Findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.07228 2025-05-27 cs.AI cs.CE 57%

ChemToolAgent: The Impact of Tools on Language Agents for Chemistry Problem Solving

Botao Yu, Frazier N. Baker, Ziru Chen, Garrett Herb, Boyu Gou, Daniel Adu-Ampratwum, Xia Ning, Huan Sun

机构 * Department of Computer Science and Engineering, OSU(计算机科学与工程系,俄勒冈州立大学) Department of Biomedical Informatics, OSU(生物医学信息学系,俄勒冈州立大学) College of Pharmacy, OSU(药学院,俄勒冈州立大学)

专题命中 Agent评测 :agent(abstract);分类 cs.AI

Comments Accepted to NAACL 2025 Findings. Previous title: Tooling or Not Tooling? The Impact of Tools on Language Agents for Chemistry Problem Solving. Based on the camera ready version, this version adds more experimental results. We also release the toolkit in ChemMCP (https://osu-nlp-group.github.io/ChemMCP), which is a continuously updated and MCP-compatible chemistry toolkit

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.17882 2025-05-26 cs.AI 57%

Formalizing Embeddedness Failures in Universal Artificial Intelligence

Cole Wyeth, Marcus Hutter

专题命中 Agent评测 :agent(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.17869 2025-05-26 cs.LG 57%

Best Group Identification in Multi-Objective Bandits

Mohammad Shahverdikondori, Mohammad Reza Badri, Negar Kiyavash

专题命中 Agent评测 :agent(abstract);分类 cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.17154 2025-05-26 q-bio.QM cs.AI 57%

Can Large Language Models Design Biological Weapons? Evaluating Moremi Bio

Gertrude Hattoh, Jeremiah Ayensu, Nyarko Prince Ofori, Solomon Eshun, Darlington Akogo

机构 * Gertrude Hattoh(第一作者) Jeremiah Ayensu(第一作者) Nyarko Prince Ofori(第一作者) Solomon Eshun(第一作者) Darlington Akogo(第一作者)

专题命中 Agent评测 :agent(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.03989 2025-05-26 cs.AI 57%

An alignment safety case sketch based on debate

Marie Davidsen Buhl, Jacob Pfau, Benjamin Hilton, Geoffrey Irving

机构 * UK AI Security Institute, Centre for the Governance of AI(英国人工智能安全研究所,人工智能治理中心) UK AI Security Institute, New York University(英国人工智能安全研究所,纽约大学) UK AI Security Institute(英国人工智能安全研究所)

专题命中 Agent评测 :agent(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.16455 2025-05-23 cs.AI cs.CY 57%

Psychology-driven LLM Agents for Explainable Panic Prediction on Social Media during Sudden Disaster Events

Mengzhu Liu, Zhengqiu Zhu, Chuan Ai, Chen Gao, Xinghong Li, Lingnan He, Kaisheng Lai, Yingfeng Chen, Xin Lu, Yong Li, Quanjun Yin

机构 * National University of Defense Technology(国防科技大学) Tsinghua University(清华大学) Sun Yat-sen University(中山大学) Jinan University(暨南大学)

专题命中 Agent评测 :agent(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.14349 2025-05-23 cs.LG 57%

Online Inverse Linear Optimization: Efficient Logarithmic-Regret Algorithm, Robustness to Suboptimality, and Lower Bound

Shinsaku Sakaue, Taira Tsuchiya, Han Bao, Taihei Oki

机构 * University of Tokyo(东京大学) RIKEN AIP(理化学研究所AIP) Kyoto University(京都大学) Institute of Statistical Mathematics(统计数学研究所) Hokkaido University(北海道大学)

专题命中 Agent评测 :agent(abstract);分类 cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.15703 2025-05-22 cs.CV cs.AI 57%

HAMF: A Hybrid Attention-Mamba Framework for Joint Scene Context Understanding and Future Motion Representation Learning

Xiaodong Mei, Sheng Wang, Jie Cheng, Yingbing Chen, Dan Xu

机构 * Hong Kong University of Science and Technology(香港科技大学)

专题命中 Agent评测 :agent(abstract);分类 cs.AI

Comments In submission

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.14209 2025-05-21 cs.AI 57%

Embedded Mean Field Reinforcement Learning for Perimeter-defense Game

Li Wang, Xin Yu, Xuxin Lv, Gangzheng Ai, Wenjun Wu

机构 * School of Artificial Intelligence, Beihang University(人工智能学院,北航) Hangzhou International Innovation Institute, Beihang University(杭州国际创新院,北航) School of Computer Science and Engineering, Beihang University(计算机科学与工程学院,北航) School of Astronautics, Beihang University(航天学院,北航)

专题命中 Agent评测 :agent(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.13808 2025-05-21 cs.NE cs.AI 57%

RAG/LLM Augmented Switching Driven Polymorphic Metaheuristic Framework

Faramarz Safi Esfahani, Ghassan Beydoun, Morteza Saberi, Brad McCusker, Biswajeet Pradhan

专题命中 Agent评测 :agent(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2409.17355 2025-05-21 cs.LG 57%

Learning Utilities from Demonstrations in Markov Decision Processes

Filippo Lazzati, Alberto Maria Metelli

专题命中 Agent评测 :agent(abstract);分类 cs.LG

Comments International Conference on Machine Learning 42 (ICML 2025)

详情

展开后加载摘要…

URL PDF HTML 收藏
2408.05517 2025-05-20 cs.CL 57%

SWIFT:A Scalable lightWeight Infrastructure for Fine-Tuning

Yuze Zhao, Jintao Huang, Jinghan Hu, Xingjun Wang, Yunlin Mao, Daoze Zhang, Hong Zhang, Zeyinzi Jiang, Zhikai Wu, Baole Ai, Ang Wang, Wenmeng Zhou, Yingda Chen

机构 * Alibaba Group(阿里巴巴集团)

专题命中 Agent评测 :agent(abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.12321 2025-05-20 cs.AI 57%

BeliefNest: A Joint Action Simulator for Embodied Agents with Theory of Mind

Rikunari Sagara, Koichiro Terao, Naoto Iwahashi

专题命中 Agent评测 :agent(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.12102 2025-05-20 cs.SE cs.IR cs.NI 57%

Scalable Time-Tagged Data Acquisition for Entanglement Distribution in Quantum Networks

Abderrahim Amlou, Thomas Gerrits, Anouar Rahmouni, Amar Abane, Mheni Merzouki, Ya-Shian Li-Baboud, Ahmed Lbath, Abdella Battou, Oliver Slattery

专题命中 Agent评测 :agent(abstract);分类 cs.SE

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.11962 2025-05-20 cs.AI 57%

CrafText Benchmark: Advancing Instruction Following in Complex Multimodal Open-Ended World

Zoya Volovikova, Gregory Gorbov, Petr Kuderov, Aleksandr I. Panov, Alexey Skrynnik

机构 * AIRI MIPT(莫斯科物理技术学院) FRC CSC RAS(俄罗斯科学院应用数学与控制论研究所)

专题命中 Agent评测 :agent(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.11534 2025-05-20 cs.RO cs.LG 57%

Empirical Performance Evaluation of Lane Keeping Assist on Modern Production Vehicles

Yuhang Wang, Abdulaziz Alhuraish, Shuyi Wang, Hao Zhou

机构 * Civil & Environmental Engineering , University of South Florida(土木与环境工程系,佛罗里达州立大学) Department of Transportation Engineering , Fuzhou University(交通运输工程系,福州大学)

专题命中 Agent评测 :planning(abstract);分类 cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.10653 2025-05-19 cs.AI 57%

On the Evaluation of Engineering Artificial General Intelligence

Sandeep Neema, Susmit Jha, Adam Nagel, Ethan Lew, Chandrasekar Sureshkumar, Aleksa Gordic, Chase Shimmin, Hieu Nguygen, Paul Eremenko

机构 * P-1 AI, Inc.(P-1 AI公司)

专题命中 Agent评测 :AI agent(abstract);分类 cs.AI

Comments 21 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.10321 2025-05-16 cs.CR cs.AI 57%

AutoPentest: Enhancing Vulnerability Management With Autonomous LLM Agents

Julius Henke

机构 * University of Amsterdam(阿姆斯特丹大学) SURF

专题命中 Agent评测 :agent(abstract);分类 cs.AI

Comments 24 pages, 1 figure, for implementation, see https://github.com/JuliusHenke/autopentest

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.09796 2025-05-16 physics.med-ph cs.AI 57%

Virtual Dosimetrists: A Radiotherapy Training "Flight Simulator"

Skylar S. Gay, Tucker Netherton, Barbara Marquez, Raymond Mumme, Mary Gronberg, Brent Parker, Chelsea Pinnix, Sanjay Shete, Carlos Cardenas, Laurence Court

机构 * The University of Texas MD Anderson Cancer Center(德克萨斯大学MD安德森癌症中心) UTHealth Graduate School of Biomedical Sciences(UT健康研究生生物医学科学学院) The University of Texas Southwestern Medical Center(德克萨斯大学西南医学中心) The University of Texas Medical Branch at Galveston(德克萨斯大学医学分支(加尔维斯顿)) The University of Alabama at Birmingham(阿拉巴马大学伯明翰分校)

专题命中 Agent评测 :planning(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.09734 2025-05-16 eess.SY cs.LG cs.RO cs.SY math.OC 57%

Risk-Aware Safe Reinforcement Learning for Control of Stochastic Linear Systems

Babak Esmaeili, Nariman Niknejad, Hamidreza Modares

机构 * Department of Mechanical Engineering, Michigan State University(机械工程系,密歇根州立大学)

专题命中 Agent评测 :agent(abstract);分类 cs.LG

Comments Submitted to Asian Journal of Control

详情

展开后加载摘要…

URL PDF HTML 收藏