arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

AI Agent

智能体、工具调用、规划、工作流、多智能体和自主任务执行。

共收录 15801 信号源:cs.AI, cs.CL, cs.LG, cs.SE

1. Agent评测 15801 篇

2506.04836 2025-09-03 cs.CY cs.AI 84%

Oversight Structures for Agentic AI in Public-Sector Organizations

Chris Schmitz, Jonathan Rystrøm, Jan Batzner

机构 * Centre for Digital Governance, Hertie School(数字治理中心,赫尔姆斯学校) Oxford Internet Institute, University of Oxford(牛津互联网研究所,牛津大学) Weizenbaum Institute Berlin, Germany(贝伦贝格Weizenbaum研究所) Technical University Munich, Germany(慕尼黑技术大学)

专题命中 Agent评测 :agentic(title,abstract);agent(abstract,journal_ref);分类 cs.AI

Comments To appear at REALM@ACL2025

Journal ref Proceedings of the 1st Workshop for Research on Agent Language Models (REALM 2025), pages 298-308, Vienna, Austria. Association for Computational Linguistics

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.10934 2024-10-18 cs.AI 84%

Agent-as-a-Judge: Evaluate Agents with Agents

Mingchen Zhuge, Changsheng Zhao, Dylan Ashley, Wenyi Wang, Dmitrii Khizbullin, Yunyang Xiong, Zechun Liu, Ernie Chang, Raghuraman Krishnamoorthi, Yuandong Tian, Yangyang Shi, Vikas Chandra, Jürgen Schmidhuber

专题命中 Agent评测 :agent(title,abstract);agentic(abstract);分类 cs.AI

Comments The project can be found at https://github.com/metauto-ai/agent-as-a-judge. The dataset is released at https://huggingface.co/DEVAI-benchmark

详情

展开后加载摘要…

URL PDF HTML 收藏
2402.02388 2024-04-02 cs.CL cs.AI cs.LG cs.SE 84%

Solution-oriented Agent-based Models Generation with Verifier-assisted Iterative In-context Learning

Tong Niu, Weihao Zhang, Rong Zhao

专题命中 Agent评测 :agent(title,abstract);分类 cs.AI、cs.CL、cs.LG;autonomous agent(journal_ref)

Journal ref International Conference on Autonomous Agents and Multiagent Systems 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.08759 2026-08-18 cs.CV cs.RO 版本更新 83%

Dissecting Embodied Abilities in Multimodal Language Models through Skill-level Evaluation and Diagnosis

通过技能级评估与诊断解构多模态语言模型的具身能力

Yu Qi, Haibo Zhao, Ziyu Guo, Siyuan Ma, Ziyan Chen, Yaokun Han, Renrui Zhang, Zitiantao Lin, Yizhe Zhu, Shiji Xin, Yijian Huang, Boce Hu, Kai Cheng, Peiheng Wang, Jiazheng Liu, Jiayi Zhang, Yizhe Zhu, Wenqing Wang, Yiran Qin, Haojie Huang, Lawson L. S. Wong

机构 * Northeastern University, Boston, MA, USA The Chinese University of Hong Kong, Hong Kong, China Peking University, Beijing, China Westlake University, Hangzhou, China Harvard University, Cambridge, MA, USA Purdue University, West Lafayette, IN, USA University of Oxford, Oxford, United Kingdom

专题命中 Agent评测 :agent(summary_cn,abstract);planning(abstract)

AI总结 本文提出BEAR基准,通过分解具身任务为14个原子技能进行细粒度评估,发现感知能力是推理失败的主要瓶颈,并提出BEAR-Agent多模态对话代理,显著提升具身技能性能。

Comments Accepted to ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.15320 2026-06-16 cs.CV 新提交 83%

Conditional Multi-Event Temporal Grounding in Long-Form Video

长视频中的条件多事件时间定位

Yuanhao Zou, Arthad Kulkarni, Lucas Tonanez, Lincoln Spencer, Guangyu Sun, Tianxingjian Ding, Andong Deng, Yi Li, Shuangjun Liu, Yuan Li, Dashan Gao, Ning Bi, Taotao Jing, Shuai Zhang, Chen Chen

机构 * University of Central Florida(中佛罗里达大学) Qualcomm AI Research(高通人工智能研究院)

专题命中 Agent评测 :agent(summary_cn,abstract);agentic(abstract)

AI总结 提出CoMET-Bench基准和CoMET-Agent框架,解决长视频中基于组合时空条件定位所有事件的任务,F1@0.5提升6.1%。

详情

展开后加载摘要…

URL PDF HTML 收藏
1602.00646 2026-06-04 eess.SY cs.RO cs.SY 83%

Autonomous Agent Behaviour Modelled in PRISM -- A Case Study

基于PRISM的自主代理行为建模——一个案例研究

Ruth Hoffmann, Murray Ireland, Alice Miller, Gethin Norman, Sandor Veres

机构 * University of Glasgow(格拉斯哥大学) University of Sheffield(谢菲尔德大学)

专题命中 Agent评测 :agent(title);autonomous agent(title)

AI总结 本文提出了一种抽象的自主性定义,用于建模自主场景,并通过小规模仿真模型推断定量数据,以验证无人飞行器在自主场景中的行为。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.10858 2026-05-12 cs.CV cs.RO 83%

Is Your Driving World Model an All-Around Player?

你的驾驶世界模型是全能选手吗?

Lingdong Kong, Ao Liang, Tianyi Yan, Hongsi Liu, Wesley Yang, Ziqi Huang, Xian Sun, Wei Yin, Jialong Zuo, Yixuan Hu, Dekai Zhu, Dongyue Lu, Youquan Liu, Guangfeng Jiang, Linfeng Li, Xiangtai Li, Long Zhuo, Lai Xing Ng, Benoit R. Cottereau, Changxin Gao, Liang Pan, Wei Tsang Ooi, Ziwei Liu

专题命中 Agent评测 :agent(summary_cn,abstract);planning(abstract)

AI总结 本文提出WorldLens基准测试,评估驾驶世界模型在视觉和行为真实性方面的综合表现,揭示现有模型在不同维度上的不足,并引入WorldLens-26K和WorldLens-Agent提升评估的可解释性。

Comments CVPR 2026 VideoWorldModel Workshop; Project Page at https://worldbench.github.io/worldlens GitHub at https://github.com/worldbench/WorldLens

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.14509 2026-04-17 cs.SE cs.AI cs.CL 83%

E2Edev: Benchmarking Large Language Models in End-to-End Software Development Task

E2EDev:端到端软件开发任务中大语言模型的基准测试

Jingyao Liu, Chen Huang, Zhizhao Guan, Wenqiang Lei, Yang Deng

机构 * College of Computer Science, Sichuan University(四川大学计算机学院) Institute of Data Science, National University of Singapore(新加坡国立大学数据科学研究所) CHAT NLP Group, Singapore Management University(新加坡国立管理大学CHAT NLP组) Engineering Research Center of Machine Learning and Industry Intelligence, Ministry of Education, China(教育部长机器学习与产业智能工程研究中心)

专题命中 Agent评测 :agent(abstract,abstract_cn);multi-agent(abstract,abstract_cn);分类 cs.AI、cs.CL、cs.SE

AI总结 本文提出E2EDev基准,基于行为驱动开发原则,通过模拟真实用户交互评估端到端软件开发框架的能力,揭示现有方法在解决复杂任务中的不足。

Comments Accepted to ACL 2026 main

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.07674 2026-04-15 q-fin.GN 83%

The relationship between general equilibrium models with infinite-lived agents and overlapping generations models, and some applications

一般均衡模型中无限寿命 agent 与重叠世代模型的关系及其一些应用

Ngoc-Sang Pham

专题命中 Agent评测 :agent(title_cn,summary_cn)

AI总结 本文研究了无限寿命 agent 一般均衡模型与重叠世代模型的关系,证明了两者在均衡条件下的相互转化,并探讨了其在经济应用中的意义。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.00465 2026-01-05 cs.RO 83%

Space Debris Removal using Nano-Satellites controlled by Low-Power Autonomous Agents

利用低功耗自主代理控制的纳米卫星进行太空碎片清除

Dennis Christmann, Juan F. Gutierrez, Sthiti Padhi, Patrick Plörer, Aditya Takur, Simona Silvestri, Andres Gomez

机构 * Institut für Datentechnik, TU Braunschweig(数据技术研究所, Braunschweig 技术大学) Institut für Raumfahrtsysteme, TU Braunschweig(航天系统研究所, Braunschweig 技术大学)

专题命中 Agent评测 :autonomous agent(title,abstract);agent(abstract,comments);multi-agent(comments)

AI总结 本文提出利用低功耗自主代理控制的纳米卫星群,用于安全清除太空碎片,通过实验验证其可行性与能耗效率。

Comments This is an open-access, author-archived version of a manuscript published in European Conference on Multi-Agent Systems 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.11197 2025-02-18 cs.IR cs.GT 83%

CSP: A Simulator For Multi-Agent Ranking Competitions

Tommy Mordo, Tomer Kordonsky, Haya Nachimovsky, Moshe Tennenholtz, Oren Kurland

专题命中 Agent评测 :agent(title);multi-agent(title)

详情

展开后加载摘要…

URL PDF HTML 收藏
2311.10287 2023-11-20 math.OC 83%

On Risk Evaluation and Control of Distributed Multi-Agent Systems

Aray Almen, Darinka Dentcheva

专题命中 Agent评测 :agent(title);multi-agent(title)

详情

展开后加载摘要…

URL PDF HTML 收藏
2008.07871 2022-09-22 q-fin.CP cs.MA q-fin.TR 83%

Fast Agent-Based Simulation Framework with Applications to Reinforcement Learning and the Study of Trading Latency Effects

Peter Belcak, Jan-Peter Calliess, Stefan Zohren

专题命中 Agent评测 :agent(title,abstract);multi-agent(abstract,comments)

Comments Presented at the International Workshop on Multi-Agent Systems and Agent-Based Simulation (MABS@AAMAS) 2021, 12 pages, 8 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2206.05510 2022-06-14 eess.SY cs.MA cs.SY 83%

An Algorithm for Exact Numerical Age-of-Information Evaluation in Multi-Agent Systems

Richard Schoeffauer, Gerhard Wunder

专题命中 Agent评测 :agent(title);multi-agent(title)

详情

展开后加载摘要…

URL PDF HTML 收藏
2105.13907 2021-05-31 cs.MA 83%

Towards a Very Large Scale Traffic Simulator for Multi-Agent Reinforcement Learning Testbeds

Zijian Hu, Chengxiang Zhuge, Wei Ma

专题命中 Agent评测 :agent(title);multi-agent(title)

Comments IJCAI 2021 Reinforcement Learning for Intelligent Transportation Systems (RL4ITS) Workshop

详情

展开后加载摘要…

URL PDF HTML 收藏
1906.12010 2019-07-01 q-fin.TR cs.GT 83%

How to Evaluate Trading Strategies: Single Agent Market Replay or Multiple Agent Interactive Simulation?

Tucker Hybinette Balch, Mahmoud Mahfouz, Joshua Lockhart, Maria Hybinette, David Byrd

专题命中 Agent评测 :agent(title,abstract);multi-agent(abstract,journal_ref)

Journal ref Presented at the 2019 ICML Workshop on AI in Finance: Applications and Infrastructure for Multi-Agent Learning. Long Beach, CA

详情

展开后加载摘要…

URL PDF HTML 收藏
2105.05589 2021-05-13 cs.SE cs.AI 83%

An Appraisal Transition System for Event-driven Emotions in Agent-based Player Experience Testing

Saba Gholizadeh Ansari, I. S. W. B. Prasetya, Mehdi Dastani, Frank Dignum, Gabriele Keller

专题命中 Agent评测 :agent(title,abstract);分类 cs.AI、cs.SE;autonomous agent(comments);multi-agent(comments)

Comments This is a preprint of an article with the same title, accepted in 9th International Workshop on Engineering Multi-Agent Systems (EMAS 2021) which was held as a part of 20th International Conference on Autonomous Agents and Multiagent Systems (AAMAS 2021)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.23501 2026-08-25 cs.SE 新提交 83%

An Interactive Agent for Requirement-Driven Candidate Sourcing

面向需求驱动型候选人挖掘的交互式智能体

Yuanpeng He, Fangjing Li, Xiangyu Ru, Kexin Sun, Kun Yang, Lijian Li, Chi-Man Pun, Qingsong Wen, Wenpin Jiao, Mingkai Guo, Yirong Feng, Daiheng Gao, Zhi Jin

专题命中 Agent评测 :agent(title,abstract);workflow(abstract);分类 cs.SE

AI总结 该研究针对自然语言描述的人才挖掘任务,提出首个交互式需求驱动型候选人挖掘智能体,在21个系统和691项需求上,其广度和召回率均优于现有基线模型。

Comments 12 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.23341 2026-08-25 cs.SE 新提交 83%

DPIAgent: Divide, Protocol, Isolate for Agentic Reproduction Test Generation

DPIAgent:面向智能体复现测试用例生成的Divide、Protocol、Isolate方法

Hao Liu, Steven Liu, Xin Zhang, Jane Luo, Yu Kang, Jie Wu, Fangkai Yang, Yangyu Huang, Pengfei Gao, Scarlett Li, Yan Lu

专题命中 Agent评测 :agentic(title,abstract);agent(abstract);分类 cs.SE

AI总结 DPIAgent是基于Divide、Protocol、Isolate原则的结构化智能体框架,将复现测试用例生成拆分为单目标阶段,在SWT-Bench Verified上优于七个基线方法,GPT-5成功率达81.76%,添加测试选择后升至86.17%,通用性良好。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.21444 2026-08-25 cs.AI cs.ET cs.HC cs.RO 新提交 83%

Agentic AI for Safety-critical Multi-drone Systems: Challenges and Opportunities

面向安全关键多无人机系统的智能体人工智能:挑战与机遇

Timothy Merritt, Alejandro Jarabo-Peñas, Juan Bravo-Arrabal, Maria-Theresa Bahodi, Anders Lyhne Christensen

机构 * Aalborg University(奥尔堡大学) University of Southern Denmark(南丹麦大学)

专题命中 Agent评测 :agentic(title,abstract);agent(abstract);分类 cs.AI

AI总结 本文针对安全关键多无人机系统应用受限问题,结合NAMUR、PERSIST项目经验,提出将智能体AI作为社会技术设计问题,采用以人为本的迭代方法开发可迁移的概念验证系统与评估策略。

Comments 9 pages, 4 figures, presented at the AgentCraft Workshop at IUI2026 Conference, https://agentcraft-iui.github.io/2026/ - CEUR-WS.org proceedings forthcoming

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.21375 2026-08-25 cs.AI 新提交 83%

SchemaRouter: Field-Aware Tool Routing for Efficient Heterogeneous Agentic RAG

SchemaRouter:面向高效异构智能体检索增强生成的字段感知工具路由

Yong-eun Cho

机构 * KailosLab(凯洛斯实验室)

专题命中 Agent评测 :agentic(title,abstract);agent(abstract);分类 cs.AI

AI总结 SchemaRouter是轻量级字段感知工具路由层,通过模式图实现工具与字段的精准选择,在材料科学基准中,其效率、准确率、工具精确率等表现优于基线,还能提供来源与许可信息。

Comments 13 pages, 4 figures, 6 tables. Code, benchmark, and fixtures: https://github.com/JDeun/SchemaRouter_research

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.21057 2026-08-24 cs.LG 新提交 83%

Designing a Robust LLM-Based Evaluation System for Agentic AI in Drug Discovery Through Human Alignment

通过人类对齐设计用于药物发现中智能体AI的鲁棒性大语言模型评估系统

Emma Granqvist, Rocío Mercado, Samuel Genheden

机构 * AstraZeneca(阿斯利康) Chalmers University of Technology(查尔姆斯理工大学) University of Gothenburg(哥德堡大学) Science for Life Laboratory (SciLifeLab)(生命科学实验室)

专题命中 Agent评测 :agentic(title,abstract);agent(abstract);分类 cs.LG

AI总结 本研究针对药物发现智能体AI,提出人类对齐的LLM作为评判者评估框架,优化后对齐度达0.86,为科学领域智能体系统评估提供可复用模板。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.20688 2026-08-24 cs.AI physics.optics 新提交 83%

VortexChat: An agentic framework for autonomous multi-objective integrated photonic design

VortexChat:面向自主多目标集成光子设计的智能体框架

Faqian Chong, Yulun Wu, Shilong Li, Andrew Forbes, Hongsheng Chen, Song Han

专题命中 Agent评测 :agentic(title,abstract);agent(abstract);分类 cs.AI

AI总结 VortexChat是结合LLM决策智能体与电磁仿真的自主设计框架,可从自然语言规格端到端设计集成光子器件,在Vortex100基准测试中无需人工介入即可生成达标器件,成功设计制备出高性能太赫兹涡旋光束复用器。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.19625 2026-08-21 cs.AI 新提交 83%

Scientific Data Skills: Enabling Agent-Ready Scientific Data Services at Scale

科学数据技能:实现规模化的智能体就绪型科学数据服务

Xiaohan Huang, Qingqing Long, Xiaolei Du, Siyu Pu, Jiawen Xu, Haotian Chen, Chenyang Zhao, Jinbiao Liu, Xuezhi Wang, Hao Wang, Hengshu Zhu, Yuanchun Zhou

机构 * Computer Network Information Center, Chinese Academy of Sciences(中国科学院计算机网络信息中心) University of the Chinese Academy of Sciences(中国科学院大学)

专题命中 Agent评测 :agent(title,abstract);AI agent(abstract);分类 cs.AI

AI总结 针对现有数据集表示难以满足AI智能体需求的问题,提出SciDSK智能体就绪型表示并构建相关平台,可提升智能体的数据集发现与解释能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.19509 2026-08-21 cs.SE 新提交 83%

An Agentic RAG and Evaluation Framework for Assurance Case Generation: Industrial Use Case for the EU Cyber Resilience Act Compliance

用于保障案例生成的智能检索增强生成与评估框架:欧盟网络弹性法案合规性的工业用例

Fariz Ikhwantri, Iker Lasa Ojanguren, Dusica Marijan, Maria I. Maslioukova, José Arias Marin, Pavlos Kosmides

专题命中 Agent评测 :agentic(title,abstract);分类 cs.SE

AI总结 该研究提出基于智能RAG的保障案例生成与评估框架,通过案例研究验证其可自动化欧盟网络弹性法案合规评定,减少人工并提升证据可追溯性。

Comments 6 pages, accepted at ISSRE 2026 (Industry track)

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.02022 2026-08-21 cs.AI 版本更新 83%

ATBench: A Diverse and Realistic Agent Trajectory Benchmark for Safety Evaluation and Diagnosis

ATBench:一个多样且现实的代理轨迹基准,用于安全评估与诊断

Yu Li, Haoyu Luo, Yuejin Xie, Yuqian Fu, Zhonghao Yang, Shuai Shao, Qihan Ren, Wanying Qu, Yanwei Fu, Yujiu Yang, Jing Shao, Xia Hu, Dongrui Liu

机构 * Shanghai AI Lab(上海人工智能实验室) Fudan University(复旦大学) Shanghai Jiao Tong University(上海交通大学) Tsinghua University(清华大学) KAUST(卡塔尔人工智能科学中心) East China Normal University(华东师范大学)

专题命中 Agent评测 :agent(title,abstract);agentic(abstract);分类 cs.AI

AI总结 ATBench通过多样化的轨迹和现实场景评估代理安全,包含1000条轨迹,挑战性强,支持跨基准比较和长周期故障诊断。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.17713 2026-08-19 cs.LG 新提交 83%

Cross-View Correspondence Is a Measurement Intervention: Two-Sided Validation for Agent Evaluation and Credit Assignment

跨视图对应是一种测量干预:智能体评估与信用分配的双面验证

Zhen Zhang, Ahmad Hafez, Amr Alanwar

机构 * School of Computation, Information and Technology(计算、信息与技术学院) Technical University of Munich(慕尼黑工业大学)

专题命中 Agent评测 :agent(title,abstract);tool-use(abstract);分类 cs.LG

AI总结 该研究指出跨视图对应是测量干预,开发含双面验证等的有效性理论,发现对应分歧会影响智能体评估,需声明验证跨视图对应以支持可靠结论。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.16900 2026-08-19 physics.soc-ph cs.AI cs.CY quant-ph 新提交 83%

QuantumNovelty: A Skill-Orchestrating Language Agent for Referee-Style Review and Patentability Screening of Quantum Papers and Patents

QuantumNovelty:用于量子论文与专利的评审式审查及可专利性筛选的技能编排语言智能体

Shlomo Kashani

专题命中 Agent评测 :agent(title,abstract);agentic(abstract);分类 cs.AI

AI总结 QuantumNovelty是一款开源技能编排语言智能体,可生成量子计算产物并通过含确定性门的审计层审查,在对抗语料库及真实手稿、专利的测试中表现出审查保守性,属于量子论文与专利审查的决策支持工具。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.16246 2026-08-18 cs.CR cs.AI 新提交 83%

CompoSkill: Compositional Skill Chain Attacks from Individually Scanner-Passing LLM Agent Skills

CompoSkill:通过可单独通过扫描器的大语言模型智能体技能实现的组合技能链攻击

Mingxiao Liu, Zhoumian Jiang, Jianan Ma, Jian Zhang, Jialuo Chen, Xinhao Deng, Zhen Wang

专题命中 Agent评测 :agent(title,abstract);AI agent(abstract);分类 cs.AI

AI总结 CompoSkill框架揭示现有单技能认证的自主AI智能体存在系统性缺口,其通过双攻击者系统构造组合技能链攻击,在白、黑盒设置下分别实现83.3%、80.6%的风险链形成率,现有扫描器拦截效果有限。

Comments 9 pages,5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.14270 2026-08-17 cs.AI 新提交 83%

TimeSage-EV: A Live Benchmark for Agentic Time Series Analysis in Evolving Environments

TimeSage-EV:面向动态环境下智能体时间序列分析的实时基准测试集

Qingren Yao, Yaxuan Kong, Yuqi Nie, Yichen Li, Stefan Zohren, Anna Vettoruzzo, Qingsong Wen, Ming Jin, Joaquin Vanschoren

机构 * Eindhoven University of Technology(埃因霍温理工大学) University of Oxford(牛津大学) VulpiVox Intelligence(VulpiVox智能公司) Squirrel Ai Learning(Squirrel AI学习公司) Griffith University(格里菲斯大学)

专题命中 Agent评测 :agentic(title,abstract);agent(abstract);分类 cs.AI

AI总结 针对现有时间序列基准未评估时间有效性等问题,推出动态环境智能体时间序列分析基准TimeSage-EV,含多领域真实场景,实验揭示模型性能差距及失败模式,提供研究资源。

详情

展开后加载摘要…

URL PDF HTML 收藏