arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

AI Agent

智能体、工具调用、规划、工作流、多智能体和自主任务执行。

共收录 15756 信号源:cs.AI, cs.CL, cs.LG, cs.SE

1. Agent评测 15756 篇

2510.01780 2025-10-03 cs.CR cs.AI cs.CY cs.LG 73%

Secure Multi-Modal Data Fusion in Federated Digital Health Systems via MCP

Aueaphum Aueawatthanaphisut

机构 * School of Information, Computer, and Communication Technology(信息、计算机与通信技术学院) Sirindhorn International Institute of Technology, Thammasat University(泰国朱拉安吞国际技术学院,泰国 Thammasat 大学)

专题命中 Agent评测 :agent(abstract);AI agent(abstract);分类 cs.AI、cs.LG

Comments 6 pages, 8 figures, 7 equations, 1 algorithm

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.24297 2025-10-01 cs.CL cs.AI 73%

Q-Mirror: Unlocking the Multi-Modal Potential of Scientific Text-Only QA Pairs

Junying Wang, Zicheng Zhang, Ye Shen, Yalun Wu, Yingji Liang, Yijin Guo, Farong Wen, Wenzhe Li, Xuezhi Zhao, Qi Jia, Guangtao Zhai

机构 * Fudan University(复旦大学) Shanghai Artificial Intelligence Laboratory(上海人工智能实验室) Shanghai Jiao Tong University(上海交通大学)

专题命中 Agent评测 :agent(abstract);agentic(abstract);分类 cs.AI、cs.CL

Comments 25 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.24002 2025-09-30 cs.CL cs.AI 73%

MCPMark: A Benchmark for Stress-Testing Realistic and Comprehensive MCP Use

Zijian Wu, Xiangyan Liu, Xinyuan Zhang, Lingjun Chen, Fanqing Meng, Lingxiao Du, Yiran Zhao, Fanshi Zhang, Yaoqi Ye, Jiawei Wang, Zirui Wang, Jinjie Ni, Yufan Yang, Arvin Xu, Michael Qizhe Shieh

专题命中 Agent评测 :agent(abstract);AI agent(abstract);分类 cs.AI、cs.CL

Comments 42 pages, 27 figures, 10 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.10482 2025-09-30 cs.LG cs.AI 73%

Fine-tuning Diffusion Policies with Backpropagation Through Diffusion Timesteps

Ningyuan Yang, Jiaxuan Gao, Feng Gao, Yi Wu, Chao Yu

机构 * Tsinghua University(清华大学)

专题命中 Agent评测 :agent(abstract);multi-agent(abstract);分类 cs.AI、cs.LG

Comments 9 pages for main text, 23 pages in total, submitted to Neurips, 13 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.15957 2025-09-22 cs.AI cs.CL cs.HC cs.IR 73%

EHR-MCP: Real-world Evaluation of Clinical Information Retrieval by Large Language Models via Model Context Protocol

Kanato Masayoshi, Masahiro Hashimoto, Ryoichi Yokoyama, Naoki Toda, Yoshifumi Uwamino, Shogo Fukuda, Ho Namkoong, Masahiro Jinzaki

机构 * Department of Radiology, Keio University Hospital, Tokyo, Japan(Keio大学医院放射科) Division of Infectious Diseases and Infection Control, Keio University Hospital, Tokyo, Japan(Keio大学医院感染病学与感染控制科)

专题命中 Agent评测 :agent(abstract);AI agent(abstract);分类 cs.AI、cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.08388 2025-09-17 cs.CL cs.AI 73%

Responsible AI in NLP: GUS-Net Span-Level Bias Detection Dataset and Benchmark for Generalizations, Unfairness, and Stereotypes

Maximus Powers, Shaina Raza, Alex Chang, Rehana Riaz, Umang Mavani, Harshitha Reddy Jonala, Ansh Tiwari, Hua Wei

专题命中 Agent评测 :agent(abstract);multi-agent(abstract);分类 cs.AI、cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.12190 2025-09-16 cs.CY cs.AI cs.CL 73%

Survival at Any Cost? LLMs and the Choice Between Self-Preservation and Human Harm

Alireza Mohamadi, Ali Yavari

专题命中 Agent评测 :agent(abstract);multi-agent(abstract);分类 cs.AI、cs.CL

Comments Preprint. Under review

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.08756 2025-09-11 cs.LG cs.AI cs.HC 73%

Using AI to Optimize Patient Transfer and Resource Utilization During Mass-Casualty Incidents: A Simulation Platform

Zhaoxun "Lorenz" Liu, Wagner H. Souza, Jay Han, Amin Madani

机构 * Surgical Artificial Intelligence Research Academy(外科人工智能研究学院) University Health Network(大学健康网络) University of Toronto(多伦多大学) Department of Surgery(外科系)

专题命中 Agent评测 :agent(abstract);AI agent(abstract);分类 cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.23674 2025-09-11 cs.LG cs.CL 73%

TweakLLM: A Routing Architecture for Dynamic Tailoring of Cached Responses

Muhammad Taha Cheema, Abeer Aamir, Khawaja Gul Muhammad, Naveed Anwar Bhatti, Ihsan Ayyub Qazi, Zafar Ayyub Qazi

机构 * Department of Computer Science(计算机科学系) Lahore University of Management Sciences(拉合尔管理科学大学)

专题命中 Agent评测 :agent(abstract);multi-agent(abstract);分类 cs.CL、cs.LG

Comments 13 pages, 9 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.24671 2025-09-03 cs.CL cs.AI 73%

Multiple LLM Agents Debate for Equitable Cultural Alignment

Dayeon Ki, Rachel Rudinger, Tianyi Zhou, Marine Carpuat

机构 * University of Maryland(马里兰大学)

专题命中 Agent评测 :agent(abstract);multi-agent(abstract);分类 cs.AI、cs.CL

Comments ACL 2025 (Oral)

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.20737 2025-08-29 cs.SE cs.AI 73%

Rethinking Testing for LLM Applications: Characteristics, Challenges, and a Lightweight Interaction Protocol

Wei Ma, Yixiao Yang, Qiang Hu, Shi Ying, Zhi Jin, Bo Du, Zhenchang Xing, Tianlin Li, Junjie Shi, Yang Liu, Linxiao Jiang

机构 * Singapore Management University Singapore Capital Normal University Beijing China Tianjin University Tianjin China Wuhan University China CSIRO's Data61 \& Australian National University Australia Nanyang Technological University Singapore Singapore Management University Capital Normal University Tianjin University Wuhan University CSIRO's Data61 \& Australian National University Nanyang Technological University

专题命中 Agent评测 :agent(abstract);AI agent(abstract);分类 cs.AI、cs.SE

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.19461 2025-08-28 cs.AI cs.CR cs.LG 73%

Reliable Weak-to-Strong Monitoring of LLM Agents

Neil Kale, Chen Bo Calvin Zhang, Kevin Zhu, Ankit Aich, Paula Rodriguez, Scale Red Team, Christina Q. Knight, Zifan Wang

机构 * Scale AI Carnegie Mellon University(卡内基梅隆大学) Massachusetts Institute of Technology(麻省理工学院)

专题命中 Agent评测 :agent(abstract);workflow(abstract);分类 cs.AI、cs.LG

Comments 18 pages, 15 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.18596 2025-08-27 cs.CL cs.AI 73%

Debate-to-Detect: Reformulating Misinformation Detection as a Real-World Debate with Large Language Models

Chen Han, Wenzhen Zheng, Xijin Tang

机构 * School of Advanced Interdisciplinary Sciences, University of Chinese Academy of Sciences(中国科学院大学先进交叉学科学院) State Key Laboratory of Mathematical Sciences, Academy of Mathematics and Systems Science, Chinese Academy of Sciences(中国科学院数学与系统科学研究院)

专题命中 Agent评测 :agent(abstract);multi-agent(abstract);分类 cs.AI、cs.CL

Comments This paper has been accepted to EMNLP 2025 (Main Conference)

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.14357 2025-08-21 cs.LG cs.AI cs.CV 73%

Organ-Agents: Virtual Human Physiology Simulator via LLMs

Rihao Chang, He Jiao, Weizhi Nie, Honglin Guo, Keliang Xie, Zhenhua Wu, Lina Zhao, Yunpeng Bai, Yongtao Ma, Lanjun Wang, Yuting Su, Xi Gao, Weijie Wang, Nicu Sebe, Bruno Lepri, Bingwei Sun

机构 * Tianjin University(天津大学) University of Trento(特伦托大学) Tianjin Medical University General Hospital(天津医科大学总医院) Chest Hospital, Tianjin University(天津大学胸科医院) The Affiliated Suzhou Hospital of Nanjing Medical University(南京医科大学附属苏州医院) Fondazione Bruno Kessler(布鲁诺·凯斯勒基金会)

专题命中 Agent评测 :agent(abstract);multi-agent(abstract);分类 cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.05668 2025-08-20 cs.IR cs.AI cs.CL 73%

A Survey of LLM-based Deep Search Agents: Paradigm, Optimization, Evaluation, and Challenges

Yunjia Xi, Jianghao Lin, Yongzhao Xiao, Zheli Zhou, Rong Shan, Te Gao, Jiachen Zhu, Weiwen Liu, Yong Yu, Weinan Zhang

机构 * Shanghai Jiao Tong University(上海交通大学)

专题命中 Agent评测 :agent(abstract);planning(abstract);分类 cs.AI、cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.13186 2025-08-20 cs.CL cs.AI cs.CV 73%

MM-BrowseComp: A Comprehensive Benchmark for Multimodal Browsing Agents

Shilong Li, Xingyuan Bu, Wenjie Wang, Jiaheng Liu, Jun Dong, Haoyang He, Hao Lu, Haozhe Zhang, Chenchen Jing, Zhen Li, Chuanhao Li, Jiayi Tian, Chenchen Zhang, Tianhao Peng, Yancheng He, Jihao Gu, Yuanxing Zhang, Jian Yang, Ge Zhang, Wenhao Huang, Wangchunshu Zhou, Zhaoxiang Zhang, Ruizhe Ding, Shilei Wen

机构 * Nanjing University(南京大学) Zhejiang University(浙江大学)

专题命中 Agent评测 :AI agent(abstract);tool use(abstract);分类 cs.AI、cs.CL

Comments The first two authors contribute equally, 26 pages, repo at https://github.com/MMBrowseComp/MM-BrowseComp

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.11310 2025-08-18 cs.CL cs.AI cs.IR 73%

SGSimEval: A Comprehensive Multifaceted and Similarity-Enhanced Benchmark for Automatic Survey Generation Systems

Beichen Guo, Zhiyuan Wen, Yu Yang, Peng Gao, Ruosong Yang, Jiaxing Shen

机构 * The Hong Kong Polytechnic University(香港理工大学) The Education University of Hong Kong(香港教育大学) China Mobile (Hong Kong) Innovation and Research Institute(中国移动(香港)创新与研究院) Lingnan University(岭南大学)

专题命中 Agent评测 :agent(abstract);multi-agent(abstract);分类 cs.AI、cs.CL

Comments Accepted to The 21st International Conference on Advanced Data Mining and Applications (ADMA2025)

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.07572 2025-08-12 cs.CL cs.AI 73%

WebWalker: Benchmarking LLMs in Web Traversal

Jialong Wu, Wenbiao Yin, Yong Jiang, Zhenglin Wang, Zekun Xi, Runnan Fang, Linhai Zhang, Yulan He, Deyu Zhou, Pengjun Xie, Fei Huang

专题命中 Agent评测 :agent(abstract);multi-agent(abstract);分类 cs.AI、cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.02694 2025-08-06 cs.AI cs.CL cs.MA 73%

Efficient Agents: Building Effective Agents While Reducing Cost

Ningning Wang, Xavier Hu, Pai Liu, He Zhu, Yue Hou, Heyuan Huang, Shengyu Zhang, Jian Yang, Jiaheng Liu, Ge Zhang, Changwang Zhang, Jun Wang, Yuchen Eleanor Jiang, Wangchunshu Zhou

专题命中 Agent评测 :agent(abstract);agentic(abstract);分类 cs.AI、cs.CL

Comments Work in progress. For GitHub repository, see https://github.com/OPPO-PersonalAI/OAgents

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.00141 2025-08-04 cs.LG cs.AI 73%

INSPIRE-GNN: Intelligent Sensor Placement to Improve Sparse Bicycling Network Prediction via Reinforcement Learning Boosted Graph Neural Networks

Mohit Gupta, Debjit Bhowmick, Rhys Newbury, Meead Saberi, Shirui Pan, Ben Beck

机构 * School of Public Health and Preventive Medicine, Monash University, Melbourne, Australia(公共卫生与预防医学学院,墨尔本大学) Department of Electrical and Computer System Engineering, Monash University, Melbourne, Australia(电气与计算机系统工程系,墨尔本大学) School of Civil and Environmental Engineering, UNSW, Sydney, Australia(土木与环境工程学院,新南威尔士大学) School of Information and Communication Technology, Griffith University, Brisbane, Australia(信息与通信技术学院,格里菲斯大学)

专题命中 Agent评测 :agent(abstract);planning(abstract);分类 cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.22947 2025-08-01 cs.CY cs.CL cs.LG 73%

ELMES: An Automated Framework for Evaluating Large Language Models in Educational Scenarios

Shou'ang Wei, Xinyun Wang, Shuzhen Bi, Jian Chen, Ruijia Li, Bo Jiang, Xin Lin, Min Zhang, Yu Song, BingDong Li, Aimin Zhou, Hao Hao

机构 * Shanghai Innavation Institute(上海创新研究院) Shanghai Institute of AI for Education(上海人工智能教育研究院) Department of Educational Information Technology(教育信息技术系) School of Computer Science and Technology(计算机科学与技术学院)

专题命中 Agent评测 :agent(abstract);multi-agent(abstract);分类 cs.CL、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.23836 2025-07-17 cs.CL cs.AI 73%

Large Language Models Often Know When They Are Being Evaluated

Joe Needham, Giles Edkins, Govind Pimpale, Henning Bartsch, Marius Hobbhahn

机构 * MATS Apollo Research ML Alignment & Theory Scholars (MATS)(机器学习对齐与理论学者(MATS))

专题命中 Agent评测 :agent(abstract);agentic(abstract);分类 cs.AI、cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.07544 2025-07-11 cs.AI cs.LG 73%

Position: We Need An Algorithmic Understanding of Generative AI

Oliver Eberle, Thomas McGee, Hamza Giaffar, Taylor Webb, Ida Momennejad

机构 * BIFOLD--Berlin Institute for the Foundations of Learning(柏林学习与数据基础研究院) University of California Los Angeles(加州大学洛杉矶分校) Halıcıoğlu Data Science Institute, University of California San Diego(哈里卡鲁斯数据科学研究所,加州大学圣地亚哥分校) Microsoft Research NYC(微软研究院纽约)

专题命中 Agent评测 :agent(abstract);multi-agent(abstract);分类 cs.AI、cs.LG

Comments Accepted at ICML 2025 as a Spotlight Position Paper

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.06825 2025-07-11 cs.LG cs.AI 73%

Artificial Generals Intelligence: Mastering Generals.io with Reinforcement Learning

Matej Straka, Martin Schmid

专题命中 Agent评测 :agent(abstract);multi-agent(abstract);分类 cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.15740 2025-07-10 cs.AI cs.CR cs.LG 73%

SHADE-Arena: Evaluating Sabotage and Monitoring in LLM Agents

Jonathan Kutasov, Yuqi Sun, Paul Colognese, Teun van der Weij, Linda Petrini, Chen Bo Calvin Zhang, John Hughes, Xiang Deng, Henry Sleight, Tyler Tracy, Buck Shlegeris, Joe Benton

机构 * Anthropic Reduct Video Scale AI Constellation Redwood Research

专题命中 Agent评测 :agent(abstract);autonomous agent(abstract);分类 cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.11010 2025-07-08 cs.CL cs.AI 73%

ReviewInstruct: A Review-Driven Multi-Turn Conversations Generation Method for Large Language Models

Jiangxu Wu, Cong Wang, TianHuang Su, Jun Yang, Haozhi Lin, Chao Zhang, Ming Peng, Kai Shi, SongPan Yang, BinQing Pan, ZiXian Li, Ni Yang, ZhenYu Yang

专题命中 Agent评测 :agent(abstract);multi-agent(abstract);分类 cs.AI、cs.CL

Comments ACL2025 Accepted

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.20249 2025-06-26 cs.AI cs.CL cs.MA 73%

Language Modeling by Language Models

Junyan Cheng, Peter Clark, Kyle Richardson

专题命中 Agent评测 :agent(abstract);multi-agent(abstract);分类 cs.AI、cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.15741 2025-06-24 cs.AI cs.CL 73%

OAgents: An Empirical Study of Building Effective Agents

He Zhu, Tianrui Qin, King Zhu, Heyuan Huang, Yeyi Guan, Jinxiang Xia, Yi Yao, Hanhao Li, Ningning Wang, Pai Liu, Tianhao Peng, Xin Gui, Xiaowan Li, Yuhui Liu, Yuchen Eleanor Jiang, Jun Wang, Changwang Zhang, Xiangru Tang, Ge Zhang, Jian Yang, Minghao Liu, Xitong Gao, Jiaheng Liu, Wangchunshu Zhou

专题命中 Agent评测 :agent(abstract);agentic(abstract);分类 cs.AI、cs.CL

Comments 28 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.15756 2025-06-23 cs.MA cs.AI cs.LG 73%

RecBayes: Recurrent Bayesian Ad Hoc Teamwork in Large Partially Observable Domains

João G. Ribeiro, Yaniv Oren, Alberto Sardinha, Matthijs Spaan, Francisco S. Melo

专题命中 Agent评测 :agent(abstract);multi-agent(abstract);分类 cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.12841 2025-06-17 cs.AI cs.CL 73%

WereWolf-Plus: An Update of Werewolf Game setting Based on DSGBench

Xinyuan Xia, Yuanyi Song, Haomin Ma, Jinyu Cai

机构 * Shanghai Jiao Tong University(上海交通大学)

专题命中 Agent评测 :agent(abstract);multi-agent(abstract);分类 cs.AI、cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏