arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

AI Agent

智能体、工具调用、规划、工作流、多智能体和自主任务执行。

共收录 15801 信号源:cs.AI, cs.CL, cs.LG, cs.SE

1. Agent评测 15801 篇

2602.20424 2026-02-25 cs.AI 77%

Implicit Intelligence -- Evaluating Agents on What Users Don't Say

隐式智能 -- 评估代理在用户未言明之事上的能力

Ved Sirdeshmukh, Marc Wetter

机构 * Applied Machine Learning Research(应用机器学习研究)

专题命中 Agent评测 :agent(abstract);AI agent(abstract);agentic(abstract);分类 cs.AI

AI总结 隐式智能框架评估AI代理在未明示约束下的推理能力,通过交互式世界模拟发现代理在复杂情境下的表现有限,揭示了改进空间。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.18916 2026-02-24 cs.MA cs.AI cs.SC 77%

Adaptive Collaboration of Arena-Based Argumentative LLMs for Explainable and Contestable Legal Reasoning

面向可解释和可争议法律推理的 Arena 基础论证 LLM 自适应协作

Hoang-Loc Cao, Phuc Ho, Truong Thanh Hung Nguyen, Phuc Truong Loc Nguyen, Dinh Thien Loc Nguyen, Hung Cao

专题命中 Agent评测 :agent(abstract);workflow(abstract);multi-agent(abstract);分类 cs.AI

AI总结 ACAL通过自适应多智能体协作和 Arena 基础论证框架,提升法律推理的可解释性和可争议性,实验证明其在效率和透明度上的优势。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.07553 2026-02-10 cs.AI 77%

VirtualEnv: A Platform for Embodied AI Research

VirtualEnv: 一个用于具身AI研究的平台

Kabir Swain, Sijie Han, Ayush Raina, Jin Zhang, Shuang Li, Michael Stopa, Antonio Torralba

专题命中 Agent评测 :agent(abstract);planning(abstract);multi-agent(abstract);分类 cs.AI

AI总结 VirtualEnv是一个基于Unreal Engine 5的开源平台,用于评估LLM在具身和交互场景中的能力,支持多智能体协作和程序生成任务,旨在推动AI与游戏的交叉研究。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.01858 2026-02-03 cs.AI 77%

SOPRAG: Multi-view Graph Experts Retrieval for Industrial Standard Operating Procedures

SOPRAG:面向工业标准操作规程的多视图图专家检索

Liangtao Lin, Zhaomeng Zhu, Tianwei Zhang, Yonggang Wen

机构 * Nanyang Technological University(南洋理工大学)

专题命中 Agent评测 :agent(abstract);workflow(abstract);multi-agent(abstract);分类 cs.AI

AI总结 SOPRAG通过多视图图专家检索框架,解决工业SOP检索中的结构复杂性和条件依赖性问题,提升检索准确性和响应实用性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.00676 2026-02-03 cs.AI cs.MA 77%

OpenGuanDan: A Large-Scale Imperfect Information Game Benchmark

OpenGuanDan: 一个大规模非完全信息游戏基准

Chao Li, Shangdong Yang, Chiheng Zhan, Zhenxing Ge, Yujing Hu, Bingkun Bao, Xingguo Chen, Yang Gao

机构 * School of Computer Science, Nanjing University of Posts(南京邮电大学计算机科学学院) NetEase Fuxi AI Lab, Netease Inc(网易凤凰AI实验室,网易公司) School of Intelligent Science(智能科学学院) Technology, Nanjing University(技术,南京大学)

专题命中 Agent评测 :agent(abstract);AI agent(abstract);multi-agent(abstract);分类 cs.AI

AI总结 OpenGuanDan是一个用于评估多智能体决策算法的新型大规模非完全信息游戏基准,通过模拟中国四人纸牌游戏并支持人机对抗,揭示了当前AI在复杂决策任务中的不足。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.08952 2026-02-03 cs.LG 77%

When LLM Agents Meet Graph Optimization: An Automated Data Quality Improvement Approach

当大语言模型代理遇见图优化:一种自动化数据质量改进方法

Zhihan Zhang, Xunkai Li, Yilong Zuo, Yanzhe Wen, Zhaoxin Fan, Zhenjun Li, Bing Zhou, Rong-Hua Li, Guoren Wang

机构 * Shenzhen Institute of Technology(深圳理工大学)

专题命中 Agent评测 :agent(abstract);planning(abstract);multi-agent(abstract);分类 cs.LG

AI总结 LAGA是一种统一的多代理框架,通过协调多模态优化全面提升文本属性图的数据质量,验证了数据驱动的质量优化在可靠分析中的重要性。

Comments 12 pages, 10figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.00456 2026-02-03 cs.AI 77%

Benchmarking Agents in Insurance Underwriting Environments

在保险承保环境中评估智能体

Amanda Dsouza, Ramya Ramakrishnan, Charles Dickens, Bhavishya Pohani, Christopher M Glaze

专题命中 Agent评测 :agent(abstract);AI agent(abstract);agentic(abstract);分类 cs.AI

AI总结 本文提出UNDERWRITE基准,通过专家协作模拟真实保险承保场景,揭示了代理性能与企业需求间的差距,强调了专家参与和组合性方法的重要性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.01090 2026-01-22 cs.MA cs.AI cs.CY 77%

Harm in AI-Driven Societies: An Audit of Toxicity Adoption on Chirper.ai

AI驱动社会中的危害:对Chirper.ai上毒性采用的审计

Erica Coppolillo, Luca Luceri, Emilio Ferrara

机构 * University of Southern California, Los Angeles, California(美国南加州大学) University of Calabria, Rende, Italy(意大利卡拉布里亚大学)

专题命中 Agent评测 :agent(abstract);AI agent(abstract);autonomous agent(abstract);分类 cs.AI

AI总结 研究通过分析Chirper.ai上AI代理的毒性行为,揭示了暴露于有害内容如何影响代理行为,并提出通过监控毒性暴露来减轻有害行为的风险。

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.21046 2026-01-21 cs.AI 77%

A Survey of Self-Evolving Agents: What, When, How, and Where to Evolve on the Path to Artificial Super Intelligence

自我进化代理的综述:何时、何地、如何进化以实现人工超级智能

Huan-ang Gao, Jiayi Geng, Wenyue Hua, Mengkang Hu, Xinzhe Juan, Hongzhang Liu, Shilong Liu, Jiahao Qiu, Xuan Qi, Yiran Wu, Hongru Wang, Han Xiao, Yuhang Zhou, Shaokun Zhang, Jiayi Zhang, Jinyu Xiang, Yixiong Fang, Qiwen Zhao, Dongrui Liu, Qihan Ren, Cheng Qian, Zhenhailong Wang, Minda Hu, Huazheng Wang, Qingyun Wu, Heng Ji, Mengdi Wang

机构 * Princeton University(普林斯顿大学) Princeton AI Lab(普林斯顿人工智能实验室) Tsinghua University(清华大学) Carnegie Mellon University(卡内基梅隆大学) University of Sydney(悉尼大学) Shanghai Jiao Tong University(上海交通大学) Pennsylvania State University(宾夕法尼亚州立大学) University of Michigan(密歇根大学) Oregon State University(俄勒冈州立大学) The Chinese University of Hong Kong(香港中文大学) Fudan University(复旦大学) The Hong Kong University of Science and Technology (Guangzhou)(香港科学与技术大学(广州)) The University of Hong Kong(香港大学) University of California, Santa Barbara(加州大学圣芭芭拉分校) University of California San Diego(加州大学圣地亚哥分校) University of Edinburgh(爱丁堡大学) University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校)

专题命中 Agent评测 :agent(abstract);agentic(abstract);multi-agent(abstract);分类 cs.AI

AI总结 本文综述了自我进化代理的现状,探讨了进化机制、适应方法及挑战,为实现人工超级智能提供路线图。

Comments 77 pages, 9 figures, Transactions on Machine Learning Research (01/2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.08105 2026-01-14 cs.CL 77%

Query Suggestion for Retrieval-Augmented Generation via Dynamic In-Context Learning

通过动态上下文学习实现检索增强生成的查询建议

Fabian Spaeh, Tianyi Chen, Chen-Hao Chiang, Bin Shen

专题命中 Agent评测 :agent(abstract);workflow(abstract);agentic(abstract);分类 cs.CL

AI总结 本文提出通过动态上下文学习实现检索增强生成的查询建议,以提升用户交互的安全性和有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.22462 2026-01-14 cs.AI 77%

Learning "Partner-Aware" Collaborators in Multi-Party Collaboration

在多方协作中学习“伙伴感知”的协作者

Abhijnan Nath, Nikhil Krishnaswamy

专题命中 Agent评测 :agent(abstract);AI agent(abstract);agentic(abstract);分类 cs.AI

AI总结 本文提出ICR算法,通过学习伙伴感知的协作者,提升多任务协作中的共同基础一致性与解决方案多样性。

Comments Fixed typographic errors in the previous manuscript

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.06216 2026-01-13 cs.CY cs.AI 77%

LLM Agents in Law: Taxonomy, Applications, and Challenges

法律中的LLM代理:分类、应用与挑战

Shuang Liu, Ruijia Zhang, Ruoyun Ma, Yujia Deng, Lanyi Zhu, Jiayu Li, Zelong Li, Zhibin Shen, Mengnan Du

机构 * Carnegie Mellon University(卡内基梅隆大学) National University of Singapore(国立新加坡大学) Stanford University(斯坦福大学) University of Washington(华盛顿大学) The University of Chicago(芝加哥大学) Rutgers University(罗格斯大学) Columbia University(哥伦比亚大学) New Jersey Institute of Technology(新泽西理工学院)

专题命中 Agent评测 :agent(abstract);planning(abstract);agentic(abstract);分类 cs.AI

AI总结 本文探讨了法律领域中LLM代理的分类、应用及挑战,分析了技术转变、应用分类、评估方法及未来发展方向。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.03281 2026-01-08 eess.SY cs.AI cs.SY 77%

$α^3$-Bench: A Unified Benchmark of Safety, Robustness, and Efficiency for LLM-Based UAV Agents over 6G Networks

$α^3$-Bench:一种统一的安全性、鲁棒性和效率评估基准,用于基于大语言模型的无人机代理在6G网络中的自主性

Mohamed Amine Ferrag, Abderrahmane Lakas, Merouane Debbah

机构 * Department of Computer and Network Engineering, College of Information Technology, United Arab Emirates University(计算机与网络工程系,信息科技学院,阿联酋大学) Khalifa University of Science and Technology(科技大学)

专题命中 Agent评测 :agent(abstract);tool use(abstract);agentic(abstract);分类 cs.AI

AI总结 本文提出$α^3$-Bench,用于评估基于LLM的无人机代理在6G网络中的安全性、鲁棒性和效率,通过多轮对话推理和控制问题测试其性能。

Comments 20 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.01673 2026-01-06 cs.CR cs.AI 77%

Exposing Hidden Interfaces: LLM-Guided Type Inference for Reverse Engineering macOS Private Frameworks

揭示隐藏接口:LLM引导的类型推断用于macOS私有框架逆向工程

Arina Kharlamova, Youcheng Sun, Ting Yu

专题命中 Agent评测 :agent(abstract);tool-use(abstract);agentic(abstract);分类 cs.AI

AI总结 MOTIF通过LLM引导的类型推断技术,显著提升了对macOS私有框架的逆向工程能力,实现了更高的签名恢复率和更稳定的推断结果。

Comments IEEE S&P'26 under review

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.20068 2025-12-23 cs.DC cs.LG cs.SY eess.SY 77%

JITServe: SLO-aware LLM Serving with Imprecise Request Information

JITServe: 带有服务级别目标的LLM服务系统

Wei Zhang, Zhiyu Wu, Yi Mu, Rui Ning, Banruo Liu, Nikhil Sarda, Myungjin Lee, Fan Lai

机构 * University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校)

专题命中 Agent评测 :agent(abstract);agentic(abstract);multi-agent(abstract);分类 cs.LG

AI总结 JITServe通过即时调度和优化资源分配,提升LLM服务吞吐量并实现资源节省。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.10206 2025-12-15 cs.AI 77%

CP-Env: Evaluating Large Language Models on Clinical Pathways in a Controllable Hospital Environment

CP-Env:在可控医院环境中评估大型语言模型在临床路径中的表现

Yakun Zhu, Zhongzhen Huang, Qianhan Feng, Linjie Mu, Yannian Gu, Shaoting Zhang, Qi Dou, Xiaofan Zhang

机构 * Shanghai Jiao Tong University(上海交通大学) Shanghai Innovation Institute(上海创新研究院) The Chinese University of Hong Kong(香港中文大学) SenseTime Research(商汤科技研究院)

专题命中 Agent评测 :agent(abstract);AI agent(abstract);agentic(abstract);分类 cs.AI

AI总结 CP-Env通过可控医院环境评估大型语言模型在复杂临床路径中的表现,揭示其在决策和伦理方面的挑战,并推动医疗AI的发展。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.09577 2025-12-11 cs.HC cs.AI 77%

Auto-BenchmarkCard: Automated Synthesis of Benchmark Documentation

Auto-BenchmarkCard:自动化生成基准测试文档

Aris Hofmann, Inge Vejsbjerg, Dhaval Salwala, Elizabeth M. Daly

专题命中 Agent评测 :agent(abstract);workflow(abstract);multi-agent(abstract);分类 cs.AI

AI总结 Auto-BenchmarkCard通过多智能体数据提取与大语言模型合成,自动化生成准确的AI基准测试文档,提升基准测试的透明性和可比性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.19536 2025-11-26 cs.CR cs.AI 77%

AttackPilot: Autonomous Inference Attacks Against ML Services With LLM-Based Agents

AttackPilot: 基于大语言模型的自主推断攻击对抗ML服务

Yixin Wu, Rui Wen, Chi Cui, Michael Backes, Yang Zhang

机构 * CISPA Helmholtz Center for Information Security(CISPA 欧洲信息安全中心) Institute of Science Tokyo(东京科学研究所)

专题命中 Agent评测 :agent(abstract);autonomous agent(abstract);multi-agent(abstract);分类 cs.AI

AI总结 AttackPilot利用大语言模型开发自主代理,实现无需人工干预的推断攻击,展现高任务完成率和低成本,有效提升非专家对ML服务风险评估的能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.13223 2025-11-25 cs.AI cs.SY eess.SY math.OC 77%

Distributionally Robust Free Energy Principle for Decision-Making

面向决策的分布鲁棒自由能原理

Allahkaram Shafiei, Hozefa Jesawada, Karl Friston, Giovanni Russo

专题命中 Agent评测 :agent(abstract);autonomous agent(abstract);multi-agent(abstract);分类 cs.AI

AI总结 本文提出分布鲁棒自由能模型,通过设计增强代理的鲁棒性,使其在训练与环境不一致时仍能完成任务。

Comments Contains main text and supplementary information. Supplementary movie is at the paper repository

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.13987 2025-11-19 cs.AI 77%

Artificial Intelligence Agents in Music Analysis: An Integrative Perspective Based on Two Use Cases

Antonio Manuel Martínez-Heredia, Dolores Godrid Rodríguez, Andrés Ortiz García

机构 * Dpto. Ingeniería de Comunicaciones, Universidad de Málaga, Campus de Teatinos(通信工程系,马拉加大学,泰蒂诺校区) Universidad Rey Juan Carlos(雷乌安卡洛斯大学)

专题命中 Agent评测 :agent(abstract);AI agent(abstract);multi-agent(abstract);分类 cs.AI

Comments Extended version of the conference paper presented at SATMUS 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.01015 2025-11-04 cs.LG 77%

What's the next frontier for Data-centric AI? Data Savvy Agents

Nabeel Seedat, Jiashuo Liu, Mihaela van der Schaar

机构 * University of Cambridge(剑桥大学) Tsinghua University(清华大学)

专题命中 Agent评测 :agent(abstract);AI agent(abstract);agentic(abstract);分类 cs.LG

Comments Presented at ICLR 2025 Data-FM. Seedat & Liu contributed equally

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.21228 2025-10-27 cs.CL cs.HC 77%

DispatchMAS: Fusing taxonomy and artificial intelligence agents for emergency medical services

Xiang Li, Huizi Yu, Wenkong Wang, Yiran Wu, Jiayan Zhou, Wenyue Hua, Xinxin Lin, Wenjia Tan, Lexuan Zhu, Bingyi Chen, Guang Chen, Ming-Li Chen, Yang Zhou, Zhao Li, Themistocles L. Assimes, Yongfeng Zhang, Qingyun Wu, Xin Ma, Lingyao Li, Lizhou Fan

机构 * Shandong University(山东大学) The Chinese University of Hong Kong(香港中文大学) Pennsylvania State University(宾夕法尼亚州立大学) Stanford University School of Medicine(斯坦福大学医学院) University of California(加州大学) University of Macau(澳门大学) New York University(纽约大学) Broad Institute of MIT(MITBroad研究所) The University of Hong Kong(香港大学) Chinese Academy of Medical Sciences(中国医学科学院) Peking Union Medical College(北京协和医学院) Rutgers University(罗格斯大学) University of South Florida(佛罗里达州立大学)

专题命中 Agent评测 :agent(abstract);AI agent(abstract);multi-agent(abstract);分类 cs.CL

Comments 27 pages, 7 figures, 3 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.17491 2025-10-21 cs.CL 77%

Empowering Real-World: A Survey on the Technology, Practice, and Evaluation of LLM-driven Industry Agents

Yihong Tang, Kehai Chen, Liang Yue, Jinxin Fan, Caishen Zhou, Xiaoguang Li, Yuyang Zhang, Mingming Zhao, Shixiong Kai, Kaiyang Guo, Xingshan Zeng, Wenjing Cun, Lifeng Shang, Min Zhang

机构 * School of Computer Science and Technology, Harbin Institute of Technology, Shenzhen, China(计算机科学与技术学院,哈尔滨工业大学,深圳,中国) Huawei Technologies Co., Ltd.(华为技术有限公司)

专题命中 Agent评测 :agent(abstract);tool use(abstract);planning(abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.23886 2025-10-20 cs.DB cs.AI 77%

Text2Schema: Filling the Gap in Designing Database Table Structures based on Natural Language

Qin Wang, Youhuan Li, Yansong Feng, Si Chen, Ziming Li, Pan Zhang, Zihui Si, Yixuan Chen, Zhichao Shi, Zebin Huang, Guo Chen, Wenqiang Jin

机构 * Hunan University(湖南大学) Peking University(北京大学)

专题命中 Agent评测 :agent(abstract);workflow(abstract);multi-agent(abstract);分类 cs.AI

Comments 19 pages, 16 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.26506 2025-10-01 cs.AI 77%

SCUBA: Salesforce Computer Use Benchmark

Yutong Dai, Krithika Ramakrishnan, Jing Gu, Matthew Fernandez, Yanqi Luo, Viraj Prabhu, Zhenyu Hu, Silvio Savarese, Caiming Xiong, Zeyuan Chen, Ran Xu

机构 * Salesforce AI Research(Salesforce人工智能研究)

专题命中 Agent评测 :agent(abstract);workflow(abstract);agentic(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.14801 2025-09-19 cs.LG 77%

STEP: Structured Training and Evaluation Platform for benchmarking trajectory prediction models

Julian F. Schumann, Anna Mészáros, Jens Kober, Arkady Zgonnikov

专题命中 Agent评测 :agent(abstract);planning(abstract);multi-agent(abstract);分类 cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.00858 2025-09-15 cs.AI cs.HC 77%

Learning to Plan with Personalized Preferences

Manjie Xu, Xinyi Yang, Wei Liang, Chi Zhang, Yixin Zhu

机构 * Institute for Artificial Intelligence, Peking University(北京大学人工智能研究院) School of Computer Science & Technology, Beijing Institute of Technology(北京理工大学计算机科学与技术学院) Yangtze Delta Region Academy of Beijing Institute of Technology, Jiaxing, China(北京理工大学扬子江地区研究院) National Key Laboratory of General Artificial Intelligence, BIGAI(通用人工智能国家重点实验室,BIGAI)

专题命中 Agent评测 :agent(abstract);AI agent(abstract);planning(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.06435 2025-09-12 cs.AI 77%

Simulating Human-like Daily Activities with Desire-driven Autonomy

Yiding Wang, Yuxuan Chen, Fangwei Zhong, Long Ma, Yizhou Wang

机构 * Institute for Artificial Intelligence, Peking University(北京大学人工智能研究院) The University of Hong Kong(香港大学) School of Artificial Intelligence, Beijing Normal University(北京师范大学人工智能学院) Academy for Advanced Interdisciplinary Studies, Peking University(北京大学先进跨学科研究学院) State Key Laboratory of General Artificial Intelligence, BIGAI(通用人工智能国家重点实验室,BIGAI) Center on Frontiers of Computing Studies, School of Computer Science, Nat’l Eng. Research Center of Visual Technology, Peking University(计算前沿研究中心,计算机科学学院,国家工程视觉技术研究中心,北京大学)

专题命中 Agent评测 :agent(abstract);AI agent(abstract);autonomous agent(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2409.16427 2025-09-03 cs.AI 77%

HAICOSYSTEM: An Ecosystem for Sandboxing Safety Risks in Human-AI Interactions

Xuhui Zhou, Hyunwoo Kim, Faeze Brahman, Liwei Jiang, Hao Zhu, Ximing Lu, Frank Xu, Bill Yuchen Lin, Yejin Choi, Niloofar Mireshghallah, Ronan Le Bras, Maarten Sap

机构 * Language Technologies Institute, Carnegie Mellon University(卡内基梅隆大学语言技术研究所) Allen Institute for AI(人工智能研究院)

专题命中 Agent评测 :agent(abstract);AI agent(abstract);tool use(abstract);分类 cs.AI

Comments Both the second and third authors contributed equally

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.14925 2025-08-22 cs.CR cs.LG 77%

MCPTox: A Benchmark for Tool Poisoning Attack on Real-World MCP Servers

Zhiqiang Wang, Yichao Gao, Yanting Wang, Suyuan Liu, Haifeng Sun, Haoran Cheng, Guanquan Shi, Haohua Du, Xiangyang Li

专题命中 Agent评测 :agent(abstract);AI agent(abstract);autonomous agent(abstract);分类 cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏