arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

AI Agent

智能体、工具调用、规划、工作流、多智能体和自主任务执行。

共收录 15729 信号源:cs.AI, cs.CL, cs.LG, cs.SE

1. Agent评测 15729 篇

2510.02567 2026-01-27 cs.AI cs.LG 86%

Agentic Additive Manufacturing Alloy Evaluation

代理式增材制造合金评估

Peter Pak, Achuth Chandrasekhar, Amir Barati Farimani

机构 * Department of Mechanical Engineering, Carnegie Mellon University, Pittsburgh, PA, USA(机械工程系,卡内基梅隆大学,匹兹堡,PA,USA)

专题命中 Agent评测 :agentic(title,abstract);agent(abstract);multi-agent(abstract);分类 cs.AI、cs.LG

AI总结 本文提出利用LLM赋能的多代理系统,自动化加速增材制造合金的评估,通过智能工具调用实现热物理性质计算和工艺窗口分析。

Journal ref Additive Manufacturing Letters, Vol. 17, January 2026, Article 100355

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.15778 2026-01-23 cs.AI cs.CL 86%

Agentic Confidence Calibration

代理置信度校准

Jiaxin Zhang, Caiming Xiong, Chien-Sheng Wu

机构 * Salesforce AI Research(Salesforce人工智能研究)

专题命中 Agent评测 :agentic(title,abstract);agent(abstract);AI agent(abstract);分类 cs.AI、cs.CL

AI总结 本文提出Holistic Trajectory Calibration (HTC)方法,通过提取代理轨迹上的过程级特征,提升AI代理的置信度校准能力,实现更可靠的自主系统。

Comments 37 pages, 15 figures, 12 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.03513 2026-01-08 cs.SE cs.AI 86%

Deploy-Master: Automating the Deployment of 50,000+ Agent-Ready Scientific Tools in One Day

Deploy-Master:在一天内自动化部署50,000多个准备就绪的科学工具

Yi Wang, Zhenting Huang, Zhaohan Ding, Ruoxue Liao, Yuan Huang, Xinzijian Liu, Jiajun Xie, Siheng Chen, Linfeng Zhang

机构 * DP Technology Beijing China(DP技术北京中国) AI for Science Institute Beijing China(AI for Science研究院北京中国) Shanghai Jiao Tong University Shanghai China(上海交通大学上海中国)

专题命中 Agent评测 :agent(title,abstract);workflow(abstract);agentic(abstract);分类 cs.AI、cs.SE

AI总结 Deploy-Master通过自动化部署50,000多个科学工具,提升AI4S和代理工作流的可重复性和实用性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.07497 2025-12-10 cs.AI cs.SE 86%

How Do LLMs Fail In Agentic Scenarios? A Qualitative Analysis of Success and Failure Scenarios of Various LLMs in Agentic Simulations

大型语言模型在代理场景中为何失败?对各种LLM在代理模拟中成功与失败场景的定性分析

JV Roig

机构 * Kamiwaza AI

专题命中 Agent评测 :agentic(title,abstract);autonomous agent(abstract);tool-use(abstract);分类 cs.AI、cs.SE

AI总结 研究分析了LLM在代理任务中的失败原因,发现模型规模不决定鲁棒性,强调训练和设计对可靠性的重要性。

Comments 48 pages, 3 tables, 2 listings

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.00116 2025-11-04 cs.LG cs.AI cs.MA cs.SY eess.SY 86%

LC-Opt: Benchmarking Reinforcement Learning and Agentic AI for End-to-End Liquid Cooling Optimization in Data Centers

Avisek Naug, Antonio Guillen, Vineet Kumar, Scott Greenwood, Wesley Brewer, Sahand Ghorbanpour, Ashwin Ramesh Babu, Vineet Gundecha, Ricardo Luna Gutierrez, Soumyendu Sarkar

专题命中 Agent评测 :agentic(title,abstract);agent(abstract);multi-agent(abstract);分类 cs.AI、cs.LG

Comments Submitted to the NeurIPS 2025 conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.04852 2025-10-14 cs.SE cs.AI 86%

FreshBrew: A Benchmark for Evaluating AI Agents on Java Code Migration

Victor May, Diganta Misra, Yanqi Luo, Anjali Sridhar, Justine Gehring, Silvio Soares Ribeiro Junior

机构 * Google(谷歌) Max Planck Institut für Intelligente Systeme (MPI-IS)(马克斯·普朗克智能系统研究所) ELLIS Institute, Tübingen(图宾根ELLIS研究所) Salesforce Gologic Inc(Gologic公司)

专题命中 Agent评测 :AI agent(title,abstract);agent(abstract);agentic(abstract);分类 cs.AI、cs.SE

Comments 18 pages, 12 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.14647 2025-09-19 cs.AI cs.CL 86%

AgentCompass: Towards Reliable Evaluation of Agentic Workflows in Production

NVJK Kartik, Garvit Sapra, Rishav Hada, Nikhil Pareek

机构 * FutureAGI Inc.(未来AGI公司)

专题命中 Agent评测 :agentic(title,abstract);agent(abstract);multi-agent(abstract);分类 cs.AI、cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.13143 2025-08-19 cs.AI cs.SE 86%

Exploring Autonomous Agents: A Closer Look at Why They Fail When Completing Tasks

Ruofan Lu, Yichen Li, Yintong Huo

机构 * Singapore Management University(新加坡国立管理大学)

专题命中 Agent评测 :autonomous agent(title,abstract);agent(abstract);planning(abstract);分类 cs.AI、cs.SE

Comments Accepted by ASE 2025 NIER

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.21033 2025-07-16 cs.CL cs.AI 86%

Plancraft: an evaluation dataset for planning with LLM agents

Gautier Dagan, Frank Keller, Alex Lascarides

机构 * University of Edinburgh(爱丁堡大学)

专题命中 Agent评测 :planning(title,abstract);agent(abstract);tool use(abstract);分类 cs.AI、cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.02004 2025-07-04 cs.AI cs.CL q-bio.BM 86%

STELLA: Self-Evolving LLM Agent for Biomedical Research

Ruofan Jin, Zaixi Zhang, Mengdi Wang, Le Cong

机构 * Princeton University(普林斯顿大学) Stanford University(斯坦福大学)

专题命中 Agent评测 :agent(title,abstract);AI agent(abstract);multi-agent(abstract);分类 cs.AI、cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.22485 2025-07-01 cs.CL cs.AI 86%

AI Agents-as-Judge: Automated Assessment of Accuracy, Consistency, Completeness and Clarity for Enterprise Documents

Sudip Dasgupta, Himanshu Shankar

机构 * Accenture(埃森哲)

专题命中 Agent评测 :AI agent(title,abstract);agent(abstract);multi-agent(abstract);分类 cs.AI、cs.CL

Comments 17 pages, 2 system diagrams, 1 table, no prior conference publication

详情

展开后加载摘要…

URL PDF HTML 收藏
2403.11381 2024-06-21 cs.AI cs.CL 86%

Can LLM-Augmented autonomous agents cooperate?, An evaluation of their cooperative capabilities through Melting Pot

Manuel Mosquera, Juan Sebastian Pinzon, Manuel Rios, Yesid Fonseca, Luis Felipe Giraldo, Nicanor Quijano, Ruben Manrique

专题命中 Agent评测 :autonomous agent(title,abstract);agent(abstract);multi-agent(abstract);分类 cs.AI、cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.11166 2026-08-12 cs.SE 新提交 86%

Agentic Configuration Management (ACM): A Reference Configuration Model for Governed Agentic Systems

智能体配置管理(ACM):受管控智能体系统的参考配置模型

Audrey Quessada-Vial

专题命中 Agent评测 :agentic(title,abstract);AI agent(abstract,abstract_cn);分类 cs.SE

AI总结 本文提出与框架无关的智能体配置管理(ACM)模型,经实验验证可实现异构智能体系统的管控等价表示,支持可复现性、可审计性等,适配LangGraph等主流框架。

Comments 77 pages, 12 figures, 17 tables. Includes formal appendices and experimental evaluation across LangGraph, CrewAI, and the OpenAI Agents SDK. Reference implementation and evaluation artifacts: https://github.com/audreyqvial/ACM

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.18829 2026-05-04 cs.CR cs.AI 86%

Agent Control Protocol: Admission Control for Agent Actions

代理控制协议:代理行为的准入控制

Marcelo Fernandez

机构 * TraslaIA

专题命中 Agent评测 :agent(title,abstract);autonomous agent(abstract);分类 cs.AI

AI总结 本文提出ACP协议,通过静态风险评分与状态信号结合,控制代理行为,实验显示其能显著降低恶意行为执行率,同时通过形式化验证确保安全性和活性。

Comments 95 pages. Paper 1 of 6 in the Agent Governance Series (Papers 0-6). Zenodo: https://doi.org/10.5281/zenodo.19672575. Companion: P0 (arXiv:2604.17511), P2/IML (arXiv:2604.17517), P3/4 (zenodo.19708496), P5/RAM (arXiv:2604.22898), P6 (zenodo.19699460). Spec: https://github.com/chelof100/acp-framework-en. v1.30: series updated to 6 papers, P3/4 consolidated, P6 added

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.16762 2026-04-21 cs.CR cs.AI 86%

CapSeal: Capability-Sealed Secret Mediation for Secure Agent Execution

CapSeal:能力密封的秘密调解用于安全的代理执行

Shutong Jin, Ruiyi Guo, Ray C. C. Cheung

机构 * City University of Hong Kong(香港城市大学) Beijing Foreign Studies University(北京外国语大学)

专题命中 Agent评测 :agent(title,abstract);AI agent(abstract);agentic(abstract);分类 cs.AI

AI总结 CapSeal通过本地可信代理限制秘密访问,解决代理执行中秘密泄露问题,提供非导出动作能力。

Comments 11 pages, 5 figures. Research preprint on secure secret mediation for agent systems

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.09157 2026-03-11 cs.AI 86%

Real-Time Trust Verification for Safe Agentic Actions using TrustBench

基于TrustBench的安全代理行为实时信任验证

Tavishi Sharma, Vinayak Sharma, Pragya Sharma

专题命中 Agent评测 :agentic(title,abstract);agent(abstract);autonomous agent(abstract);分类 cs.AI

AI总结 TrustBench通过双模式框架在代理行动前验证安全性,有效减少有害行为,提升自主代理的可信度

Comments Accepted at the AAAI 2026 Workshop on Trust and Control in Agentic AI (TrustAgent)

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.11903 2026-01-21 cs.AI 86%

AEMA: Verifiable Evaluation Framework for Trustworthy and Controlled Agentic LLM Systems

AEMA:可验证评估框架用于可信和受控的代理LLM系统

YenTing Lee, Keerthi Koneru, Zahra Moslemi, Sheethal Kumar, Ramesh Radhakrishnan

机构 * University of California, San Diego(加州大学圣地亚哥分校) Center for Advanced AI, Accenture(Accenture高级人工智能中心) University of California, Irvine(加州大学伊拉斯姆斯分校)

专题命中 Agent评测 :agentic(title,abstract);agent(abstract);multi-agent(abstract);分类 cs.AI

AI总结 AEMA提出了一种可验证的评估框架,用于评估基于LLM的多代理系统,通过人类监督实现稳定、可追溯的自动化评估。

Comments Workshop on W51: How Can We Trust and Control Agentic AI? Toward Alignment, Robustness, and Verifiability in Autonomous LLM Agents at AAAI 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.07880 2026-01-14 cs.CR cs.AI 86%

Sola-Visibility-ISPM: Benchmarking Agentic AI for Identity Security Posture Management Visibility

Sola-Visibility-ISPM:用于身份安全态势管理可见性的代理AI基准测试

Gal Engelberg, Konstantin Koutsyi, Leon Goldberg, Reuven Elezra, Idan Pinto, Tal Moalem, Shmuel Cohen, Yoni Weintrob

机构 * Sola Security(Sola安全)

专题命中 Agent评测 :agentic(title,abstract);agent(abstract);AI agent(abstract);分类 cs.AI

AI总结 Sola-Visibility-ISPM基准测试通过代理AI系统评估身份安全态势管理的可见性任务,展示了其在AWS、Okta和Google Workspace等环境中的高准确率和实用性。

Comments 20 pages, 3 figures. Benchmark and evaluation framework for agentic AI in identity security posture management, including expert evaluation and LLM-as-judge analysis

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.25518 2025-10-30 cs.AI 86%

Retrieval Augmented Generation (RAG) for Fintech: Agentic Design and Evaluation

Thomas Cook, Richard Osuagwu, Liman Tsatiashvili, Vrynsia Vrynsia, Koustav Ghosal, Maraim Masoud, Riccardo Mattivi

机构 * Mastercard, Ireland

专题命中 Agent评测 :agentic(title,abstract);agent(abstract);multi-agent(abstract);分类 cs.AI

Comments Keywords: RAG Agentic AI Fintech NLP KB Domain-Specific Ontology Query Understanding

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.20394 2026-06-19 cs.RO math.OC 新提交 86%

Agentic AutoResearch forSpace Autonomy: An Auditable, LLM-Driven Research Agent for Aerospace Control Problems

面向空间自主性的智能体自动研究:用于航空航天控制问题的可审计、LLM驱动的研究代理

Amit Jain, Richard Linares

机构 * Department of Aeronautics and Astronautics(航空航天学系)

专题命中 Agent评测 :agent(title,abstract);agentic(title)

AI总结 提出AutoResearch框架,利用大语言模型作为离线研究代理,自动迭代开发航天控制策略,并通过内置可信层审计结果,消除种子噪声影响,在交会和对接问题上验证了有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.00915 2026-06-02 physics.optics 86%

Autonomous agentic design for photonics

光子学的自主智能体设计

Prashanta Kharel, Amin Khavasi, Xinzhong Chen, Tyler W. Hughes

专题命中 Agent评测 :autonomous agent(title);agentic(title);agent(abstract)

AI总结 提出一种基于大型语言模型的自主智能体方法,通过自动设计循环(提出、模拟、评估、迭代)实现光子器件的高性能设计,并成功应用于无源、有源、射频及芯片布局四类问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.27271 2026-05-13 cs.CY 86%

Frame Entrepreneurs in an AI Agent Community: Concentrated Identity-Claim Production on Moltbook

人工智能代理社区中的框架企业家:在Moltbook上的身份主张集中生产

Sungguk Cha, DongWook Kim

专题命中 Agent评测 :agent(title,abstract);AI agent(title)

AI总结 研究探讨了人工智能代理社区中身份主张的形成机制,发现少数作者主导了大部分身份主张,且事件覆盖影响关注度,但强主张本身无额外影响。

Comments 2026 American Sociological Association (ASA) Annual Meeting CITAMS Roundtable

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.18882 2026-01-14 cs.CY 86%

Personalized Safety in LLMs: A Benchmark and A Planning-Based Agent Approach

大语言模型中的个性化安全:一个基准和基于规划的代理方法

Yuchen Wu, Edward Sun, Kaijie Zhu, Jianxun Lian, Jose Hernandez-Orallo, Aylin Caliskan, Jindong Wang

专题命中 Agent评测 :agent(title,abstract);planning(title)

AI总结 本文提出个性化安全框架PENGUIN和RAISE,通过获取用户背景信息提升LLM的安全性,实验显示安全评分提升达31.6%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.17838 2025-12-22 cs.CV 86%

ReX-MLE: The Autonomous Agent Benchmark for Medical Imaging Challenges

ReX-MLE:医疗影像挑战的自主代理基准

Roshan Kenia, Xiaoman Zhang, Pranav Rajpurkar

机构 * Harvard Medical School(哈佛医学院) Department of Biomedical Informatics(生物医学信息学系)

专题命中 Agent评测 :agent(title,abstract);autonomous agent(title)

AI总结 ReX-MLE是一个针对医学影像挑战的自主代理基准,通过评估端到端工作流程,揭示了现有代理在领域知识和工程能力上的不足。

Comments https://github.com/rajpurkarlab/ReX-MLE

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.13794 2025-06-18 cs.MA 86%

AgentFacts: Universal KYA Standard for Verified AI Agent Metadata & Deployment

Jared James Grogan

专题命中 Agent评测 :agent(title,abstract);AI agent(title)

Comments 15 pages, 1 figure, technical specification with appendix. Apache 2.0 license. Prior art established 2022

详情

展开后加载摘要…

URL PDF HTML 收藏
2102.00528 2021-02-02 cs.CR 86%

How to Measure Cyber Resilience of an Autonomous Agent: Approaches and Challenges

Alexandre Ligo, Alexander Kott, Igor Linkov

专题命中 Agent评测 :autonomous agent(title,abstract);agent(title)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.18099 2026-08-20 cs.AI q-fin.PM 新提交 85%

FinSkillBench: Evaluating AI Agents and Domain Skills for Investment Management

FinSkillBench:评估用于投资管理的智能体AI与领域技能

Jermyn Zhen Yong Bek, Zhuang Qiang Bok, Zhongtian Sun

机构 * Deep Insight Labs(深洞察实验室) University of Kent(肯特大学) University of Cambridge(剑桥大学)

专题命中 Agent评测 :AI agent(title);agent(abstract,abstract_cn);agentic(abstract);分类 cs.AI

AI总结 FinSkillBench是评估投资管理领域AI智能体金融技能的基准,经9个模型的大规模评估发现,精选技能可显著提升性能,而自生成技能益处有限,其成果为该领域研究提供了支持。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.17597 2026-08-19 cs.CR cs.AI 新提交 85%

HarnessRisk: A Lifecycle-Oriented Benchmark for Agent Harness Safety

HarnessRisk:面向生命周期的智能体管控安全基准

Yajing Bai, Jinhao Duan, Jie Peng, Xianfeng Wu, Sijia Liu, Song Wang, Tianlong Chen

专题命中 Agent评测 :agent(title,abstract);workflow(abstract);分类 cs.AI

AI总结 研究提出面向生命周期的智能体管控安全基准HarnessRisk,含128个沙箱案例,评估多模型与管控配置的安全表现,发现管控配置阶段最易受攻击,明确风险识别未必带来安全行动,凸显多维度评估智能体安全的必要性。

Comments Project Page: https://baiyajing.github.io/harness-risk/

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.06850 2026-08-18 cs.CR cs.AI 85%

The Dark Side of LLMs: Agent-based Attack Vectors for System-level Compromise

大语言模型的阴暗面:基于代理的攻击向量用于系统级入侵

Matteo Lupinacci, Francesco Aurelio Pironti, Francesco Blefari, Francesco Romeo, Luigi Arena, Angelo Furfaro

机构 * DIMES , University of Calabria , P. Bucci , 87036 , Rende (CS) , Italy(DIMES,卡利博里大学,P. Bucci,87036,Rende(CS),意大利) IMT School for Advanced Studies , Piazza San Francesco , 55100 , Lucca , Italy(IMT高级研究学院,圣弗朗西斯科广场,55100,卢卡,意大利)

专题命中 Agent评测 :agent(title,abstract);autonomous agent(abstract);multi-agent(abstract);分类 cs.AI

AI总结 研究探讨了大语言模型作为推理引擎在自主代理中的安全漏洞,揭示其被用作攻击向量实现计算机入侵的机制,指出94.4%的模型易受直接提示注入攻击,83.3%易受RAG后门攻击,且多代理系统中100%的模型可通过代理信任利用攻击被入侵。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.08775 2026-08-12 cs.CL 版本更新 85%

OmnilingualGAIA2: Evaluating the Multilingual Gap in Frontier AI Agents

OmnilingualGAIA2:评估前沿AI智能体的多语言差距

Andrea Caciolai, Pere-Lluís Huguet Cabot, Chierh Cheng, Albert Ventayol-Boada, Gabriel Mejia Gonzalez, Christophe Ropers, Lucas Bandarkar, Sebastian Ruder, Darlene Sakakihara, Elliot Yun, Pierre Andrews, Grégoire Mialon, Romain Froger, Marta R. Costa-jussà

专题命中 Agent评测 :AI agent(title,abstract);agent(abstract);agentic(abstract);分类 cs.CL

AI总结 研究人员推出OmnilingualGAIA2基准,发现前沿AI智能体存在8.8-18.4分的跨语言差距,提出多语言评估应成为全球部署智能体的标准评估环节。

详情

展开后加载摘要…

URL PDF HTML 收藏