arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

AI Agent

智能体、工具调用、规划、工作流、多智能体和自主任务执行。

2026-03-03 至 2026-03-03 共收录 64 信号源:cs.AI, cs.CL, cs.LG, cs.SE

1. Agent评测 64 篇

2603.01952 2026-03-03 cs.AI 86%

LiveCultureBench: a Multi-Agent, Multi-Cultural Benchmark for Large Language Models in Dynamic Social Simulations

LiveCultureBench: 一种多智能体、多文化的大型语言模型动态社会模拟基准

Viet-Thanh Pham, Lizhen Qu, Thuy-Trang Vu, Gholamreza Haffari, Dinh Phung

机构 * Department of Data Science & AI, Monash University(数据科学与人工智能系,墨尔本大学)

专题命中 Agent评测 :agent(title);multi-agent(title);autonomous agent(abstract);分类 cs.AI

AI总结 LiveCultureBench通过模拟动态社会环境,评估大型语言模型在文化规范遵守与任务完成之间的平衡,研究其跨文化鲁棒性和评估可靠性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.00472 2026-03-03 cs.AI cs.SE 86%

From Goals to Aspects, Revisited: An NFR Pattern Language for Agentic AI Systems

从目标到方面,重新审视:面向智能体AI系统的NFR模式语言

Yijun Yu

机构 * The Open University(开放大学)

专题命中 Agent评测 :agentic(title,abstract);agent(abstract);autonomous agent(abstract);分类 cs.AI、cs.SE

AI总结 本文提出面向智能体AI系统的NFR模式语言,通过目标驱动的方法系统发现和模块化交叉切面问题,提升系统可靠性。

Comments 12 pages, submitted

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.00846 2026-03-03 cs.IR cs.LG 85%

Tiny-Critic RAG: Empowering Agentic Fallback with Parameter-Efficient Small Language Models

Tiny-Critic RAG:赋能代理回退的参数高效小型语言模型

Yichao Wu, Penghao Liang, Yafei Xiang, Mengwei Yuan, Jianan Liu, Jing Yang, Xianyou Li, Weiran Yan

机构 * Northeastern University(东北大学) Washington University in St. Louis(华盛顿大学圣路易斯分校) New York University(纽约大学)

专题命中 Agent评测 :agentic(title,abstract);agent(abstract);autonomous agent(abstract);分类 cs.LG

AI总结 Tiny-Critic RAG通过参数高效的Small Language Model实现低延迟的二进制路由,有效降低代理部署成本。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.00468 2026-03-03 cs.SE 85%

Cloud-OpsBench: A Reproducible Benchmark for Agentic Root Cause Analysis in Cloud Systems

Cloud-OpsBench: 一种可重现的云系统代理根本原因分析基准

Yilun Wang, Guangba Yu, Haiyu Huang, Zirui Wang, Yujie Huang, Pengfei Chen, Michael R. Lyu

专题命中 Agent评测 :agentic(title,abstract);agent(abstract);multi-agent(abstract);分类 cs.SE

AI总结 Cloud-OpsBench 是一个用于云系统代理根本原因分析的可重现基准,通过构建确定性数字孪生,提供数据引擎、强化学习环境和诊断标准,支持下一代SRE研究。

Comments 22 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.01564 2026-03-03 cs.CR 85%

From Secure Agentic AI to Secure Agentic Web: Challenges, Threats, and Future Directions

从安全代理AI到安全代理网络:挑战、威胁与未来方向

Zhihang Deng, Jiaping Gui, Weinan Zhang

专题命中 Agent评测 :agentic(title,abstract);agent(abstract);tool use(abstract)

AI总结 本文探讨了从安全代理AI到安全代理网络的过渡,分析了代理系统在开放网络环境中的安全挑战与威胁,并提出了应对策略和未来研究方向。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.01051 2026-03-03 cs.LG cs.AI cs.CL 85%

GEM: A Gym for Agentic LLMs

GEM:代理大语言模型的训练环境

Zichen Liu, Anya Sims, Keyu Duan, Changyu Chen, Simon Yu, Xiangxin Zhou, Haotian Xu, Shaopan Xiong, Bo Liu, Chenmien Tan, Chuen Yang Beh, Weixun Wang, Hao Zhu, Weiyan Shi, Diyi Yang, Michael Shieh, Yee Whye Teh, Wee Sun Lee, Min Lin

机构 * Sea AI Lab(海智实验室) NUS(国立大学新加坡) Oxford(牛津大学) SMU(南卫理安大学) Stanford(斯坦福大学) Northeastern(东北大学) OpenRLHF(开放强化学习基金会) ROLL RL2 absolute AI(绝对人工智能)

专题命中 Agent评测 :agentic(title,abstract);agent(abstract);分类 cs.AI、cs.CL、cs.LG

AI总结 GEM是一个为代理LLM设计的开源训练环境,提供标准化接口、多样化环境和基准测试功能,用于促进基于经验的学习和强化学习算法的评估。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.00214 2026-03-03 cs.SE cs.AI cs.MS physics.geo-ph 84%

Agentic Scientific Simulation: Execution-Grounded Model Construction and Reconstruction

代理科学模拟:基于执行的模型构建与重建

Knut-Andreas Lie, Olav Møyner, Elling Svee, Jakob Torben

机构 * SINTEF Digital(SINTEF数字研究院) Department of Mathematical Sciences(数学科学系) NTNU(挪威特纳厄大学)

专题命中 Agent评测 :agentic(title,abstract);agent(abstract);分类 cs.AI、cs.SE

AI总结 本文提出JutulGPT,通过代理科学模拟实现基于执行的模型构建与重建,解决模拟描述中的歧义问题,并公开所有代码和日志以确保可重现性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.00858 2026-03-03 econ.TH cs.AI cs.IT cs.SY eess.SY math.IT 83%

Artificial Superintelligence May be Useless: Equilibria in the Economy of Multiple AI Agents

人工超智能可能无用:多智能体经济中的均衡

Huan Cai, Ziqing Lu, Catherine Xu, Weiyu Xu, Jie Zheng

专题命中 Agent评测 :AI agent(title,abstract);agent(abstract);分类 cs.AI

AI总结 本文研究了多智能体经济中的均衡,发现除非代理能翻倍边际效用,否则不会发生购买行为,且更强大AI代理可能对低能力代理贡献零效用。

Comments 20 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.00462 2026-03-03 cs.CV cs.AI 83%

OPGAgent: An Agent for Auditable Dental Panoramic X-ray Interpretation

OPGAgent: 一种用于可审计牙科全景X光解读的智能体

Zhaolin Yu, Litao Yang, Ben Babicka, Ming Hu, Jing Hao, Anthony Huang, James Huang, Yueming Jin, Jiasong Wu, Zongyuan Ge

机构 * AIM for Health Lab Faculty of Information Technology, Monash University(信息科技学院,莫纳什大学) Monash University(莫纳什大学) Curae Health Faculty of Dentistry, The University of Hong Kong(牙科学院,香港大学) National University of Singapore(新加坡国立大学) Southeast University(东南大学)

专题命中 Agent评测 :agent(title,abstract);agentic(abstract);分类 cs.AI

AI总结 OPGAgent是一种用于可审计牙科全景X光解读的智能体系统,通过多工具协调和共识机制,在结构化报告和VQA评估中优于现有牙科VLMs和医疗智能体框架。

Comments 10 pages, 2 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.00318 2026-03-03 cs.CR cs.AI 83%

AESP: A Human-Sovereign Economic Protocol for AI Agents with Privacy-Preserving Settlement

AESP:面向AI代理的人类主权经济协议:具有隐私保护的结算

Jian Sheng Wang

专题命中 Agent评测 :AI agent(title,abstract);agent(abstract);分类 cs.AI

AI总结 AESP是一种面向AI代理的人类主权经济协议,通过五种机制确保代理在经济上具备能力但不具有主权,同时实现隐私保护和高效结算。

Comments 16 pages, 1 figure

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.12282 2026-03-03 cs.AI cs.LG 82%

AISSISTANT: Human-AI Collaborative Review and Perspective Research Workflows in Data Science

AIssistant: 人机协作的数据科学科研与视角研究工作流

Sasi Kiran Gaddipati, Farhana Keya, Gollam Rabby, Sören Auer

机构 * TIB Leibniz Information Centre for Science and Technology(图灵信息科学与技术研究所) L3S Research Center(L3S研究中心)

专题命中 Agent评测 :agent(abstract);workflow(abstract);agentic(abstract);multi-agent(abstract)

AI总结 AIssistant通过人机协作框架提升数据科学科研与视角研究的效率和质量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.00822 2026-03-03 cs.SE cs.AI 81%

ContextCov: Deriving and Enforcing Executable Constraints from Agent Instruction Files

ContextCov: 从代理指令文件中推导并强制执行可执行约束

Reshabh K Sharma

机构 * University of Washington(华盛顿大学)

专题命中 Agent评测 :agent(title,abstract);分类 cs.AI、cs.SE

AI总结 ContextCov通过从代理指令文件中推导并强制执行可执行约束,解决代理在执行复杂软件任务时因上下文漂移导致的技术债务问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.02081 2026-03-03 cs.DB cs.AI cs.CL cs.LG cs.MA 80%

GenDB: The Next Generation of Query Processing -- Synthesized, Not Engineered

GenDB:查询处理的下一代——合成而非工程

Jiale Lao, Immanuel Trummer

机构 * Cornell University(康奈尔大学)

专题命中 Agent评测 :agent(abstract);agentic(abstract);multi-agent(abstract);分类 cs.AI、cs.CL、cs.LG

AI总结 GenDB利用大语言模型合成查询执行代码,以替代传统复杂的查询处理引擎,实现更高效和定制化的查询处理系统。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.02176 2026-03-03 cs.CL 79%

Organizing, Orchestrating, and Benchmarking Agent Skills at Ecosystem Scale

在生态系统层面组织、协调和基准测试代理技能

Hao Li, Chunjiang Mu, Jianhao Chen, Siyue Ren, Zhiyao Cui, Yiqun Zhang, Lei Bai, Shuyue Hu

机构 * Shanghai Artificial Intelligence Laboratory(上海人工智能实验室)

专题命中 Agent评测 :agent(title,abstract);分类 cs.CL

AI总结 本文提出AgentSkillOS框架,通过树状检索和DAG协调提升大规模技能生态系统的管理和任务解决能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2408.06361 2026-03-03 q-fin.TR cs.CL 79%

Large Language Model Agent in Financial Trading: A Survey

金融交易中的大语言模型代理:综述

Han Ding, Yinheng Li, Junhao Wang, Hang Chen, Doudou Guo, Yunbai Zhang

机构 * Columbia University(哥伦比亚大学) New York University(纽约大学)

专题命中 Agent评测 :agent(title,abstract);分类 cs.CL

AI总结 本文综述了利用大语言模型作为代理进行金融交易的研究,探讨了代理架构、数据输入、回测表现及面临的挑战,并展望了未来研究方向。

Journal ref International Conference on Computers in Management and Business 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.01024 2026-03-03 cs.HC cs.AI cs.MA 79%

SimAB: Simulating A/B Tests with Persona-Conditioned AI Agents for Rapid Design Evaluation

SimAB:基于人格条件化AI代理的A/B测试模拟用于快速设计评估

Tim Rieder, Marian Schneider, Mario Truss, Vitaly Tsaplin, Alina Rublea, Sinem Dere, Francisco Chicharro Sanz, Tobias Reiss, Mustafa Doga Dogan

机构 * ETH Zurich(苏黎世联邦理工学院) Adobe(Adobe公司) Adobe Research(Adobe研究)

专题命中 Agent评测 :AI agent(title,abstract);分类 cs.AI

AI总结 SimAB通过人格条件化AI代理模拟A/B测试,实现快速设计评估,准确率达67%,在高置信度案例中提升至83%。

Comments 18 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.00285 2026-03-03 cs.AI 79%

TraderBench: How Robust Are AI Agents in Adversarial Capital Markets?

TraderBench: AI代理在对抗性资本市场中的鲁棒性如何?

Xiaochuang Yuan, Hui Xu, Silvia Xu, Cui Zou, Jing Xiong

机构 * Amazon.com Inc.(亚马逊公司) Stony Brook University(石溪大学) Stanford University(斯坦福大学) University of Oklahoma(俄克拉荷马大学) UC Santa Cruz(加州大学圣克鲁兹分校)

专题命中 Agent评测 :AI agent(title,abstract);分类 cs.AI

AI总结 TraderBench通过结合静态任务与对抗性交易模拟,评估AI代理在动态市场中的鲁棒性,发现现有模型在加密交易中表现稳定但缺乏真实适应性。

Comments Equal Contribution: Xiaochuang Yuan and Hui Xu contributed equally to this work. All correspondence should be directed to yxc20098@gmail.com. Submitted to Agents in the Wild Workshop, ICLR2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.11332 2026-03-03 cs.DC cs.MA 79%

UFO3: Weaving the Digital Agent Galaxy

UFO3:编织数字代理银河

Chaoyun Zhang, Liqun Li, He Huang, Chiming Ni, Bo Qiao, Si Qin, Yu Kang, Minghua Ma, Qingwei Lin, Saravan Rajmohan, Dongmei Zhang

专题命中 Agent评测 :agent(title,abstract)

AI总结 UFO3通过统一异构设备,实现高效且健壮的任务编排,提升跨设备协作与智能整合。

Comments We developed UFO$^3$ as a fully engineered system with over 73K lines of code, encompassing agent implementations and integrations for Windows, Linux, and Android mobile devices. The entire project is open-sourced at https://github.com/microsoft/UFO/, accompanied by detailed documentation and tutorials at https://microsoft.github.io/UFO/

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.16179 2026-03-03 cs.AI cs.LG 79%

EnterpriseBench Corecraft: Training Generalizable Agents on High-Fidelity RL Environments

EnterpriseBench Corecraft: 在高保真RL环境中训练通用智能体

Sushant Mehta, Logan Ritchie, Suhaas Garre, Ian Niebres, Nick Heiner, Edwin Chen

机构 * Surge AI

专题命中 Agent评测 :agent(abstract);AI agent(abstract);agentic(abstract);分类 cs.AI、cs.LG

AI总结 在高保真RL环境中训练智能体,通过CoreCraft环境验证其在多步骤领域任务中的泛化能力,提升任务通过率并转移至多个基准测试。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.01189 2026-03-03 cs.RO cs.HC 78%

Agent-Based Simulation of Trust Development in Human-Robot Teams: An Empirically-Validated Framework

基于代理的机器人团队信任发展模拟:一个经实证验证的框架

Ravi Kalluri

专题命中 Agent评测 :agent(title,abstract)

AI总结 本文提出一个经实证验证的代理模型,用于模拟人类-机器人团队中的信任动态,揭示了机器人可靠性对信任和绩效的关键影响。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.01146 2026-03-03 cs.LO 78%

Uniform Agent-interpolation of Distributed Knowledge

分布式知识的统一代理插值

Youan Su

专题命中 Agent评测 :agent(title,abstract)

AI总结 本文提出了一种纯语法算法,用于确定具有分布式知识的模态逻辑K、KD和KT的统一插值公式。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.00825 2026-03-03 cs.CV 78%

COMBAT: Conditional World Models for Behavioral Agent Training

COMBAT:基于行为代理训练的条件世界模型

Anmol Agarwal, Pranay Meshram, Sumer Singh, Saurav Suman, Andrew Lapp, Shahbuland Matiana, Louis Castricato, Spencer Frazier

机构 * Overworld AI Indian Institute of Science Education and Research Bhopal(印度科学教育与研究学院博帕尔分校)

专题命中 Agent评测 :agent(title,abstract)

AI总结 COMBAT通过在Tekken 3中训练实时动作控制的世界模型,利用扩散模型模拟动态对手,实现对玩家行为的响应性训练。

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.13772 2026-03-03 cs.GT 78%

Quantile agent utility and implications to randomized social choice

分位数代理效用及其对随机社会选择的影响

Ioannis Caragiannis, Fabian Frank, Sanjukta Roy

专题命中 Agent评测 :agent(title,abstract)

AI总结 本文提出分位数代理效用概念,通过比较代表者来评估随机结果,展示了在随机社会选择中效率、公平和无策略性可以同时满足的可能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.01257 2026-03-03 cs.CR cs.SE 77%

A Systematic Study of LLM-Based Architectures for Automated Patching

对基于大语言模型的自动补丁架构的系统研究

Qingxiao Xu, Ze Sheng, Zhicheng Chen, Jeff Huang

专题命中 Agent评测 :agent(abstract);workflow(abstract);multi-agent(abstract);分类 cs.SE

AI总结 本文系统研究了基于LLM的自动补丁架构,通过统一基准评估四种范式,揭示了不同架构在效率、灵活性和泛化能力上的权衡,发现通用代码代理在性能上表现最优。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.01864 2026-03-03 cs.CV cs.RO 75%

Streaming Real-Time Trajectory Prediction Using Endpoint-Aware Modeling

基于端点意识建模的流式实时轨迹预测

Alexander Prutsch, David Schinagl, Horst Possegger

机构 * Institute of Visual Computing, Graz University of Technology(视觉计算研究所,格拉茨技术大学)

专题命中 Agent评测 :agent(abstract);planning(abstract);multi-agent(abstract)

AI总结 本文提出了一种基于端点意识建模的轻量高效流式轨迹预测方法,通过连续时间上下文传播提升预测精度并降低推理延迟,适用于自动驾驶场景。

Comments WACV 2026 Oral. Project Page at https://a-pru.github.io/seam/

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.01023 2026-03-03 cs.RO cs.AI 74%

An Open-Source Modular Benchmark for Diffusion-Based Motion Planning in Closed-Loop Autonomous Driving

面向闭环自动驾驶的开源模块化扩散运动规划基准

Yun Li, Simon Thompson, Yidu Zhang, Ehsan Javanmardi, Manabu Tsukada

机构 * Graduate School of Information Science and Technology, The University of Tokyo(信息科学与技术研究生学校,东京大学) TIER IV, Inc.(TIER IV公司)

专题命中 Agent评测 :planning(title);分类 cs.AI

AI总结 本研究提出开源模块化扩散运动规划基准,通过分解单体规划器并实现原生C++去噪循环,实现实车部署中运行时可配置的求解器参数和去噪过程的可观测性。

Comments 8 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.13575 2026-03-03 cs.CL cs.AI 73%

Elo-Evolve: A Co-evolutionary Framework for Language Model Alignment

Elo-Evolve:一种用于语言模型对齐的共进化框架

Jing Zhao, Ting Zhen, Junwei Bao, Hongfei Jiang, Yang Song

机构 * Zuoyebang, Beijing, China(北京中关村)

专题命中 Agent评测 :agent(abstract);multi-agent(abstract);分类 cs.AI、cs.CL

AI总结 Elo-Evolve通过动态多代理竞争和自适应对手选择,提升大型语言模型对齐的稳定性与效果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.24282 2026-03-03 cs.CL cs.AI 73%

SimuHome: A Temporal- and Environment-Aware Benchmark for Smart Home LLM Agents

SimuHome: 一个时间与环境感知的智能家庭LLM代理基准

Gyuhyeon Seo, Jungwoo Yang, Junseong Pyo, Nalim Kim, Jonggeun Lee, Yohan Jo

机构 * Graduate School of Data Science, Seoul National University(首尔国立大学数据科学研究生院) Department of Information Systems, Hanyang University(翰阳大学信息系统系)

专题命中 Agent评测 :agent(abstract);workflow(abstract);分类 cs.AI、cs.CL

AI总结 SimuHome是一个基于Matter协议的智能家庭LLM代理基准,用于评估智能家庭代理在时间与环境感知方面的能力,特别是工作流调度的挑战。

Comments Accepted at ICLR 2026 (Oral)

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.00051 2026-03-03 cs.DL cs.AI cs.LG 73%

LitBench: A Graph-Centric Large Language Model Benchmarking Tool For Literature Tasks

LitBench: 一种面向文献任务的图中心大型语言模型基准评估工具

Andreas Varvarigos, Ali Maatouk, Jiasheng Zhang, Ngoc Bui, Jialin Chen, Leandros Tassiulas, Rex Ying

机构 * Yale University(耶鲁大学)

专题命中 Agent评测 :agent(abstract);AI agent(abstract);分类 cs.AI、cs.LG

AI总结 LitBench是一种用于评估领域特定文献任务的大型语言模型基准工具,通过生成领域特定的文献子图和任务集,提升模型在文献相关任务中的表现。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.23415 2026-03-03 cs.AI 70%

From Conversation to Query Execution: Benchmarking User and Tool Interactions for EHR Database Agents

从对话到查询执行:为电子健康记录数据库代理构建用户和工具交互基准

Gyubok Lee, Woosog Chay, Heeyoung Kwak, Yeong Hwa Kim, Haanju Yoo, Oksoon Jeong, Meong Hi Son, Edward Choi

机构 * KAIST(韩国科学技术院) NAVER Cloud(NAVER云) Samsung Medical Center(三星医疗中心)

专题命中 Agent评测 :agent(abstract);workflow(abstract);分类 cs.AI

AI总结 EHR-ChatQA通过模拟环境评估数据库代理在处理用户查询模糊性和价值不匹配时的性能,揭示了构建安全关键EHR领域中鲁棒代理的重要性。

Comments ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏