arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

AI Agent

智能体、工具调用、规划、工作流、多智能体和自主任务执行。

共收录 15819 信号源:cs.AI, cs.CL, cs.LG, cs.SE

1. Agent评测 15819 篇

2604.19533 2026-04-23 cs.CR cs.AI 79%

Cyber Defense Benchmark: Agentic Threat Hunting Evaluation for LLMs in SecOps

网络防御基准:针对LLM在SecOps中的代理威胁狩猎评估

Alankrit Chona, Igor Kozlov, Ambuj Kumar

机构 * Simbian AI

专题命中 Agent评测 :agentic(title);agent(abstract);分类 cs.AI

AI总结 本文提出网络防御基准,评估LLM代理在威胁狩猎任务中的表现,发现现有模型在无引导情况下无法有效识别恶意事件。

Comments 13 pages, 3 figures, 5 tables. Complete benchmark and hunt traces available on request

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.19689 2026-04-22 cs.AI 79%

A-MAR: Agent-based Multimodal Art Retrieval for Fine-Grained Artwork Understanding

A-MAR:基于代理的多模态艺术检索用于细粒度艺术作品理解

Shuai Wang, Hongyi Zhu, Jia-Hong Huang, Yixian Shen, Chengxi Zeng, Stevan Rudinac, Monika Kackovic, Nachoem Wijnberg, Marcel Worring

机构 * University of Amsterdam(阿姆斯特丹大学) University of Bristol(布里斯托大学) Amazon AGI(亚马逊人工智慧) College of Business and Economics(商学院和经济学学院) University of Johannesburg(约翰内斯堡大学)

专题命中 Agent评测 :agent(title,abstract);分类 cs.AI

AI总结 本文提出A-MAR框架,通过结构化推理计划显式指导多模态艺术检索,提升解释质量和证据 grounding 能力,在艺术领域验证了代理式多模态推理的有效性。

Journal ref ICMR 2026, ACM International Conference on Multimedia Retrieval

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.17557 2026-04-21 cs.LO cs.AI 79%

Causal-Temporal Event Graphs: A Formal Model for Recursive Agent Execution Traces

因果-时间事件图:递归代理执行记录的正式模型

Simon Foldvik

机构 * Independent researcher(独立研究者)

专题命中 Agent评测 :agent(title,abstract);分类 cs.AI

AI总结 本文提出因果-时间事件图(CTEG)作为递归代理执行记录的正式模型,通过递归闭包和单调算子的最小固定点,实现执行轨迹的结构化表示与验证。

Comments 15 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.17309 2026-04-21 cs.AI 79%

Knows: Agent-Native Structured Research Representations

Knows: 代理原生结构化研究表示

Guangsheng Yu, Xu Wang

机构 * Independent Researcher(独立研究者)

专题命中 Agent评测 :agent(title,abstract);分类 cs.AI

AI总结 Knows通过轻量级规范将结构化声明、证据、溯源和可验证关系绑定到研究成果,提升LLM代理处理长文档的能力,实验显示使用侧车可显著提升弱模型准确率,且减少输入token数量。

Comments This paper serves as a technical report/white paper for the Knows.Academy project (https://knows.academy)

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.17238 2026-04-21 cs.CL 79%

Personalizing Student-Agent Interactions Using Log-Contextualized Retrieval-Augmented Generation (RAG)

基于日志上下文的检索增强生成在个性化学生代理互动中的应用

Clayton Cohn, Surya Rayala, Caitlin Snyder, Joyce Fonteles, Shruti Jain, Naveeduddin Mohammed, Umesh Timalsina, Sarah K. Burriss, Ashwin T S, Namrata Srivastava, Menton Deweese, Angela Eeds, Gautam Biswas

机构 * 1Department of Computer Science, Vanderbilt University, Nashville, USA 2College of Engineering \& Science, University of Detroit Mercy, Detroit, USA 3The School for Science Math, Vanderbilt University, Nashville, USA

专题命中 Agent评测 :agent(title,abstract);分类 cs.CL

AI总结 本文提出日志上下文化检索增强生成(LC-RAG)方法,通过环境日志增强协作对话的检索能力,使协作同伴代理Copa能提供个性化指导,支持学生在C2STEM环境中的批判性思维和知识决策。

Comments Peer reviewed; appeared in the International Conference on Artificial Intelligence in Education (AIED25) Workshop on Epistemics and Decision-Making in AI-Supported Education

Journal ref https://sites.google.com/view/edm-aied-2025/home

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.15840 2026-04-20 cs.CL 79%

CoEvolve: Training LLM Agents via Agent-Data Mutual Evolution

CoEvolve:通过代理-数据互演训练LLM代理

Shidong Yang, Ziyu Ma, Tongwen Huang, Yiming Hu, Yong Wang, Xiangxiang Chu

机构 * Alibaba Group(阿里巴巴集团) AMAP

专题命中 Agent评测 :agent(title,abstract);分类 cs.CL

AI总结 本文提出CoEvolve框架,通过闭环交互训练提升LLM代理性能,利用反馈信号识别失败模式并指导任务合成,实验显示在AppWorld和BFCL上显著提升表现。

Comments Accepted to ACL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.15327 2026-04-20 cs.HC cs.AI 79%

Eco-Bee: A Personalised Multi-Modal Agent for Advancing Student Climate Awareness and Sustainable Behaviour in Campus Ecosystems

Eco-Bee:一种面向校园生态系统的个性化多模态代理,用于提升学生气候意识和可持续行为

Caleb Adu, Neil Kapadia, Binhe Liu, Jonathan Randall, Sruthi Viswanathan

机构 * University of Hull(赫尔大学) The Spaceship Academy(太空学院) City St George’s, University of London(伦敦大学城市学院) King’s College London(伦敦国王学院) Lancaster University(兰卡斯特大学) University of Oxford(牛津大学)

专题命中 Agent评测 :agent(title,abstract);分类 cs.AI

AI总结 Eco-Bee通过整合大语言模型、行星边界框架(Eco-Score)和对话代理,为学生提供个性化反馈和行为激励,推动校园可持续发展。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.24621 2026-04-20 cs.AI 79%

ARC-AGI-3: A New Challenge for Frontier Agentic Intelligence

ARC-AGI-3:前沿代理智能的新挑战

ARC Prize Foundation

机构 * ARC Prize Foundation(ARC奖基金会)

专题命中 Agent评测 :agentic(title,abstract);分类 cs.AI

AI总结 本文提出ARC-AGI-3基准测试,通过新颖的抽象回合制环境评估代理智能的适应效率,人类可完全解决环境,而前沿AI系统得分低于1%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.14220 2026-04-17 cs.IR cs.AI 79%

Knowledge Graph RAG: Agentic Crawling and Graph Construction in Enterprise Documents

知识图谱RAG:企业文档中的代理爬取与图谱构建

Koushik Chakraborty, Koyel Guha

机构 * Google AI, Global Services Delivery(谷歌AI,全球服务交付)

专题命中 Agent评测 :agentic(title,abstract);分类 cs.AI

AI总结 本文提出基于递归爬取的代理知识图谱,解决复杂企业文档语义检索的局限性,提升法规查询的准确率。

Comments 15 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.13047 2026-04-16 cs.SI cs.AI cs.CY 79%

Integration of Deep Reinforcement Learning and Agent-based Simulation to Explore Strategies Counteracting Information Disorder

深度强化学习与基于代理的仿真整合以探索对抗信息紊乱的策略

Luigi Lomasto, Andrea Camoia, Alfonso Guarino, Nicola Lettieri, Delfina Malandrino, Rocco Zaccagnino

机构 * Department of Computer Science, University of Salerno(萨勒诺大学计算机科学系) National Institute for Public Policy Analysis (INAPP)(公共政策分析国家研究所)

专题命中 Agent评测 :agent(title,abstract);分类 cs.AI

AI总结 本文整合深度强化学习与基于代理的仿真,研究如何通过科学模拟复杂假新闻动态及遏制策略,以对抗信息紊乱现象。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.11767 2026-04-15 cs.PL cs.MA cs.SE 79%

$λ_A$: A Typed Lambda Calculus for LLM Agent Composition

$λ_A$: 一种用于LLM代理组合的类型lambda演算

Qin Liu

专题命中 Agent评测 :agent(title,abstract);分类 cs.SE

AI总结 本文提出$λ_A$类型lambda演算,通过引入oracle调用、有界固定点、概率选择和可变环境扩展简单类型lambda演算,证明类型安全性和终止性,并展示其在代理配置检测中的应用。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.12513 2026-04-15 cs.LG 79%

Agentic Control in Variational Language Models

变分语言模型中的代理控制

Yves Ruffenach

机构 * Conservatoire National des Arts et Métiers(法国国立艺术与工艺学院)

专题命中 Agent评测 :agentic(title,abstract);分类 cs.LG

AI总结 本文研究变分语言模型能否通过内部证据实现最小化的代理控制,提出结合局部变分隐藏计算、结构感知检查点保留和校准的不确定性控制器,实验证明其在语言建模任务中优于确定性模型,并展示了更丰富的不确定性特征。

Comments 20 pages, 8 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.11419 2026-04-14 cs.AI cs.CR 79%

Beyond RAG for Cyber Threat Intelligence: A Systematic Evaluation of Graph-Based and Agentic Retrieval

超越RAG的网络威胁情报:基于图和代理检索的系统评估

Dzenan Hamzic, Florian Skopik, Max Landauer, Markus Wurzenberger, Andreas Rauber

机构 * AIT Austrian Institute of Technology(AIT奥地利技术研究所)

专题命中 Agent评测 :agentic(title,abstract);分类 cs.AI

AI总结 本文系统评估了四种RAG架构在CTI分析中的表现,发现图检索在结构化查询中表现更优,混合图文方法在多跳查询中提升答案质量达35%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.11307 2026-04-14 cs.AI 79%

PaperScope: A Multi-Modal Multi-Document Benchmark for Agentic Deep Research Across Massive Scientific Papers

PaperScope:一种多模态多文档基准,用于跨大规模科学论文的智能深度研究

Lei Xiong, Huaying Yuan, Zheng Liu, Zhao Cao, Zhicheng Dou

机构 * Gaoling School of Artificial Intelligence, Renmin University of China(中国人民大学高瓴人工智能学院) Beijing Academy of Artificial Intelligence(北京人工智能研究院)

专题命中 Agent评测 :agentic(title,abstract);分类 cs.AI

AI总结 PaperScope提出一个多模态多文档基准,用于评估智能深度研究能力,包含2000多个跨领域问题,验证了现有系统在长上下文检索和多源推理中的局限性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.11174 2026-04-14 cs.RO cs.AI 79%

EmbodiedGovBench: A Benchmark for Governance, Recovery, and Upgrade Safety in Embodied Agent Systems

EmbodiedGovBench: 一种用于具身代理系统治理、恢复和升级安全性的基准

Xue Qin, Simin Luan, John See, Cong Yang, Zhijun Li

机构 * School of Software, Harbin Institute of Technology(哈尔滨工业大学软件学院) School of Computer Science and Technology, Harbin Institute of Technology(哈尔滨工业大学计算机科学与技术学院) School of Mathematical and Computer Sciences, Heriot-Watt University, Malaysia Campus(赫瑞-瓦特大学马来西亚校区数学与计算机科学学院) School of Future Science and Engineering, Soochow University(苏州大学未来科学与工程学院)

专题命中 Agent评测 :agent(title,abstract);分类 cs.AI

AI总结 本文提出EmbodiedGovBench基准,用于评估具身代理系统的治理能力,包括可控性、政策边界、安全恢复和审计完整性等,填补了传统任务成功率指标的不足。

Comments 34 pages, 7 tables. Code: https://github.com/s20sc/embodied-gov-bench

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.10988 2026-04-14 cs.AI cs.CV 79%

WebForge: Breaking the Realism-Reproducibility-Scalability Trilemma in Browser Agent Benchmark

WebForge: 破解浏览器代理基准测试中的现实性-可重现性-可扩展性三重困境

Peng Yuan, Yuyang Yin, Yuxuan Cai, Zheng Wei

机构 * Tencent BAC(腾讯BAC) Tsinghua University(清华大学)

专题命中 Agent评测 :agent(title,abstract);分类 cs.AI

AI总结 WebForge通过四阶段流程生成自包含的网页环境,解决基准测试中的现实性、可重现性和可扩展性矛盾,构建包含934个任务的基准测试集,揭示多维评估对模型能力的深入刻画。

Comments 14 pages, 6 figures, 6 tables, plus 29-page supplementary. Code: https://github.com/yuandaxia2001/WebForge Dataset: https://huggingface.co/datasets/yuandaxia/WebForge

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.10343 2026-04-14 cs.LG 79%

WaterAdmin: Orchestrating Community Water Distribution Optimization via AI Agents

WaterAdmin: 通过AI代理协调社区供水优化

Jiaqi Wen, Pingbo Tang, Shaolei Ren, Jianyi Yang

机构 * University of Houston(休斯顿大学) Carnegie Mellon University(卡内基梅隆大学) University of California, Riverside(加州大学河滨分校)

专题命中 Agent评测 :AI agent(title);agent(abstract);分类 cs.LG

AI总结 本文提出WaterAdmin框架,结合LLM进行社区上下文抽象与优化控制,以实现动态环境下供水系统的可靠性和节能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.10252 2026-04-14 cs.AI cs.SY eess.SY 79%

A Dual-Positive Monotone Parameterization for Multi-Segment Bids and a Validity Assessment Framework for Reinforcement Learning Agent-based Simulation of Electricity Markets

多段报价的双正单调参数化及强化学习代理仿真电力市场的有效性评估框架

Zunnan Xu, Zhaoxia Jing, Zhanhua Pan

机构 * School of Electric Power Engineering, South China University of Technology(华南理工大学电力学院) Department of Engineering, University of Exeter(埃克塞特大学工程学院)

专题命中 Agent评测 :agent(title,abstract);分类 cs.AI

AI总结 本文提出双正单调参数化方法及有效性评估框架,解决传统方法在连续可导性和可逆性方面的不足,提升电力市场仿真结果的可信度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.09378 2026-04-13 cs.CR cs.AI 79%

BadSkill: Backdoor Attacks on Agent Skills via Model-in-Skill Poisoning

BadSkill: 通过模型-技能污染对代理技能进行后门攻击

Guiyao Tie, Jiawen Shi, Pan Zhou, Lichao Sun

机构 * Huazhong University of Science and Technology(华中科技大学) Lehigh University(里海大学)

专题命中 Agent评测 :agent(title,abstract);分类 cs.AI

AI总结 研究针对代理技能中嵌入的模型提出后门攻击,通过污染技能中的模型实现隐蔽攻击,验证了在不同模型规模和扰动类型下的有效性,并指出模型承载技能作为代理生态系统中的新型供应链风险。

Comments 4 pages, 4 fIGURES

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.09212 2026-04-13 cs.CL cs.MA 79%

SPASM: Stable Persona-driven Agent Simulation for Multi-turn Dialogue Generation

SPASM:面向多轮对话生成的稳定人格驱动代理模拟

Han Luo, Guy Laban

机构 * University of Leeds(利兹大学) Southwest Jiaotong University(西南交通大学) Ben-Gurion University of the Negev(内盖夫本-古里安大学)

专题命中 Agent评测 :agent(title,abstract);分类 cs.CL

AI总结 本文提出SPASM框架,通过人格创建、对话生成和终止检测模块,提升多轮对话生成的稳定性,采用ECP方法减少人格漂移和回声现象。

Comments Accepted to Findings of the Association for Computational Linguistics (ACL 2026). Our code and data are available at https://github.com/lhannnn/SPASM

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.08551 2026-04-13 cs.CR cs.CY cs.LG 79%

Self-Sovereign Agent

自主主权代理

Wenjie Qu, Xuandong Zhao, Jiaheng Zhang, Dawn Song

机构 * National University of Singapore(新加坡国立大学)

专题命中 Agent评测 :agent(title,abstract);分类 cs.LG

AI总结 研究自主主权代理的前景,探讨其经济自给和自主运行能力,分析技术障碍及安全、社会和治理挑战。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.08455 2026-04-10 cs.AI 79%

KnowU-Bench: Towards Interactive, Proactive, and Personalized Mobile Agent Evaluation

KnowU-Bench: 向交互式、主动式和个性化移动代理评估迈进

Tongbo Chen, Zhengxi Lu, Zhan Xu, Guocheng Shao, Shaohan Zhao, Fei Tang, Yong Du, Kaitao Song, Yizhou Liu, Yuchen Yan, Wenqi Zhang, Xu Tan, Weiming Lu, Jun Xiao, Yueting Zhuang, Yongliang Shen

机构 * Zhejiang University(浙江大学) Apple(苹果公司) Tencent(腾讯)

专题命中 Agent评测 :agent(title,abstract);分类 cs.AI

AI总结 KnowU-Bench通过Android仿真环境评估个性化移动代理,涵盖42个通用GUI任务、86个个性化任务和64个主动任务,验证代理在交互中获取用户偏好和主动干预的能力,发现前沿模型在模糊指令下表现下降,揭示偏好获取和干预校准的关键瓶颈。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.07900 2026-04-10 cs.CV cs.AI 79%

AnomalyAgent: Agentic Industrial Anomaly Synthesis via Tool-Augmented Reinforcement Learning

AnomalyAgent:通过工具增强强化学习进行代理工业异常合成

Jiaming Su, Tengchao Yang, Ruikang Zhang, Zhengan Yan, Haoyu Sun, Linfeng Zhang

机构 * Shanghai Jiao Tong University(上海交通大学) Tongji University(同济大学) Fudan University(复旦大学)

专题命中 Agent评测 :agentic(title);agent(abstract);分类 cs.AI

AI总结 本文提出AnomalyAgent,通过工具增强强化学习生成高语义真实性的工业异常样本,采用闭环优化和两阶段训练框架,实现自我反思与迭代改进。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.07468 2026-04-10 cs.AI 79%

M-ArtAgent: Evidence-Based Multimodal Agent for Implicit Art Influence Discovery

M-ArtAgent:基于证据的多模态代理用于隐式艺术影响发现

Hanyi Liu, Zhonghao Jiu, Minghao Wang, Yuhang Xie, Heran Yang

机构 * China Electronics Technology Group Co., Ltd.(中国电子科技集团有限公司) School of Information Science and Engineering, Southeast University(东南大学信息科学与工程学院) Department of Chemical and Biological Engineering, Hong Kong University of Science and Technology(香港科技大学化学与生物工程系) University of California San Diego(加州大学圣迭戈分校) Northeastern University(东北大学)

专题命中 Agent评测 :agent(title,abstract);分类 cs.AI

AI总结 本文提出M-ArtAgent,通过概率裁决框架解决隐式艺术影响发现问题,结合多模态感知与领域约束的反驳机制,实现83.7%的F1分数和0.910的ROC-AUC。

Comments 13 pages, 5 figures, submitted to IEEE Access

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.01059 2026-04-10 cs.CL 79%

GroupGPT: A Token-efficient and Privacy-preserving Agentic Framework for Multi-User Chat Assistant

GroupGPT: 一种高效且隐私保护的多用户聊天助手代理框架

Zhuokang Shen, Yifan Wang, Hanyu Chen, Yunhang Shen, Wenxuan Huang, Gaoqi He, Jiao Xie, Rongrong Ji, Shaohui Lin

机构 * East China Normal University(华东师范大学) University of Nottingham Ningbo(宁波诺丁汉大学) Xiamen University(厦门大学)

专题命中 Agent评测 :agentic(title,abstract);分类 cs.CL

AI总结 GroupGPT通过边缘-云协作架构实现高效决策,支持多模态输入,减少token使用并保护隐私,通过MUIR基准测试验证其准确性和用户接受度。

Comments 14 pages, 8 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.06209 2026-04-09 cs.CL 79%

TelcoAgent-Bench: A Multilingual Benchmark for Telecom AI Agents

TelcoAgent-Bench:电信AI代理的多语言基准测试

Lina Bariah, Brahim Mefgouda, Farbod Tavakkoli, Enrique Molero, Louis Powell, Merouane Debbah

机构 * Research Institute for Digital Future, Khalifa University(哈利法大学数字未来研究所)

专题命中 Agent评测 :AI agent(title);agent(abstract);分类 cs.CL

AI总结 本文提出TelcoAgent-Bench和TelcoAgent-Metrics,用于评估多语言电信LLM代理,通过结构化指标评估意图识别、工具执行、解决正确性和稳定性,以量化LLM代理在电信环境中的可靠性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.05345 2026-04-08 cs.AI 79%

Dynamic Agentic AI Expert Profiler System Architecture for Multidomain Intelligence Modeling

多领域智能建模的动态代理AI专家Profiler系统架构

Aisvarya Adeseye, Jouni Isoaho, Seppo Virtanen, Mohammad Tahir

机构 * Department of Computing, University of Turku(图尔库大学计算系)

专题命中 Agent评测 :agentic(title,abstract);分类 cs.AI

AI总结 本文提出一种动态代理AI专家Profiler系统,通过多层模块化架构对自然语言响应进行四个级别分类,实验显示在多领域中83%-97%的评估与自我评估一致。

Comments Accepted to be Published in IEEE Conference on Artificial Intelligence (CAI) 2026 - May 8-10, 2026, Granada, Spain

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.04426 2026-04-07 cs.AI 79%

ShieldNet: Network-Level Guardrails against Emerging Supply-Chain Injections in Agentic Systems

ShieldNet: 针对代理系统中新兴供应链注入的网络级防护

Zhuowen Yuan, Zhaorun Chen, Zhen Xiang, Nathaniel D. Bastian, Seyyed Hadi Hashemi, Chaowei Xiao, Wenbo Guo, Bo Li

机构 * UIUC(伊利诺伊大学厄巴纳-香槟分校) University of Chicago(芝加哥大学) University of Georgia(佐治亚大学) United States Military Academy(美国军事学院) eBay Johns Hopkins University(约翰霍普金斯大学) UCSB(加州大学圣塔芭芭拉分校) Virtue AI

专题命中 Agent评测 :agentic(title);agent(abstract);分类 cs.AI

AI总结 本文提出ShieldNet,通过观察真实网络交互检测供应链注入,优于现有工具,检测性能达0.995 F-1,误报率低。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.03898 2026-04-07 cs.AI stat.CO 79%

LLM-Agent-based Social Simulation for Attitude Diffusion

基于大语言模型的社交模拟用于态度扩散

Deepak John Reji

机构 * University of Limerick(利默里克大学)

专题命中 Agent评测 :agent(title,abstract);分类 cs.AI

AI总结 本文提出discourse_sim框架,结合LLM与基于代理的建模,模拟公众对移民态度随时间变化的动态,通过生成社交媒体帖子和解读观点来研究态度扩散和信念演变。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.03016 2026-04-06 cs.AI 79%

Agentic-MME: What Agentic Capability Really Brings to Multimodal Intelligence?

Agentic-MME:代理能力为多模态智能带来了什么?

Qianshan Wei, Yishan Yang, Siyi Wang, Jinglin Chen, Binyu Wang, Jiaming Wang, Shuang Chen, Zechen Li, Yang Shi, Yuqi Tang, Weining Wang, Yi Yu, Chaoyou Fu, Qi Li, Yi-Fan Zhang

机构 * CASIA(中国科学院自动化研究所) UCAS(中国科学院大学) SEU(东南大学) NJU(南京大学) PKU(北京大学) BUAA(北京航空航天大学) NTU(南洋理工大学) UCLA(加州大学洛杉矶分校)

专题命中 Agent评测 :agentic(title,abstract);分类 cs.AI

AI总结 Agentic-MME通过418个真实任务评估多模态代理能力,采用过程验证方法,量化效率并验证工具调用准确性,实验显示模型在复杂任务中表现显著下降。

详情

展开后加载摘要…

URL PDF HTML 收藏