arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

AI Agent

智能体、工具调用、规划、工作流、多智能体和自主任务执行。

共收录 15801 信号源:cs.AI, cs.CL, cs.LG, cs.SE

1. Agent评测 15801 篇

2603.20953 2026-03-24 cs.CR cs.AI 83%

Before the Tool Call: Deterministic Pre-Action Authorization for Autonomous AI Agents

在工具调用之前:自主AI代理的确定性预行动授权

Uchi Uchibeke

机构 * APort Technologies Inc.(APort技术公司)

专题命中 Agent评测 :AI agent(title,abstract);agent(abstract);分类 cs.AI

AI总结 本文提出Open Agent Passport,通过同步拦截工具调用、评估声明性策略并生成加密审计记录,实现自主AI代理的确定性预授权,提升安全性和可控性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.18197 2026-03-20 cs.AI cs.CR cs.NI 83%

Access Controlled Website Interaction for Agentic AI with Delegated Critical Tasks

受控网站交互用于代理AI的委托关键任务

Sunyoung Kim, Hokeun Kim

机构 * Arizona State University(亚利桑那州立大学)

专题命中 Agent评测 :agentic(title,abstract);AI agent(abstract);分类 cs.AI

AI总结 本文提出一种受控网站交互设计,用于代理AI执行关键任务,通过细粒度访问控制机制提升安全性与效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.17639 2026-03-19 cs.AI 83%

VeriGrey: Greybox Agent Validation

VeriGrey:灰盒代理验证

Yuntong Zhang, Sungmin Kang, Ruijie Meng, Marcel Böhme, Abhik Roychoudhury

机构 * National University of Singapore(新加坡国立大学)

专题命中 Agent评测 :agent(title,abstract);agentic(abstract);分类 cs.AI

AI总结 本文提出VeriGrey方法,通过工具调用序列反馈函数驱动测试过程,发现LLM代理中隐含的提示注入漏洞,并在实际案例中验证其有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.15639 2026-03-19 cs.AI 83%

The Comprehension-Gated Agent Economy: A Robustness-First Architecture for AI Economic Agency

基于理解的智能体经济:面向AI经济代理的鲁棒性优先架构

Rahul Baxi

机构 * Independent Researcher(独立研究者)

专题命中 Agent评测 :agent(title,abstract);AI agent(abstract);分类 cs.AI

AI总结 本文提出Comprehension-Gated Agent Economy架构,通过对抗鲁棒性审计生成验证函数,实现经济权限的鲁棒性约束,确保经济安全与竞争力。

Comments v2: updated correspondence email

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.16586 2026-03-18 cs.AI 83%

Runtime Governance for AI Agents: Policies on Paths

AI代理的运行时治理:路径上的政策

Maurits Kaptein, Vassilis-Javed Khan, Andriy Podstavnychy

机构 * Eindhoven University of Technology(埃因霍温理工大学) Kyvvu B.V.(Kyvvu公司)

专题命中 Agent评测 :AI agent(title,abstract);agent(abstract);分类 cs.AI

AI总结 本文提出通过路径作为核心对象,研究AI代理运行时治理,探讨路径依赖政策的框架与实现,分析合规性评估及开放问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.16161 2026-03-18 cs.AI 83%

SQL-ASTRA: Alleviating Sparse Feedback in Agentic SQL via Column-Set Matching and Trajectory Aggregation

SQL-ASTRA: 缓解代理SQL中的稀疏反馈 via 列集匹配和轨迹聚合

Long Li, Zhijian Zhou, Jiangxuan Long, Peiyang Liu, Weidi Xu, Zhe Wang, Shirui Pan, Chao Qu

机构 * Griffith University(格里菲斯大学) Fudan University(复旦大学) The University of Hong Kong(香港大学) Peking University(北京大学) InFly Shanghai Innovation Institute(上海创新研究院) Shanghai Academy of Artificial Intelligence for Science(上海人工智能科学研究院)

专题命中 Agent评测 :agentic(title,abstract);agent(abstract);分类 cs.AI

AI总结 本文提出SQL-ASTRA框架,通过列集匹配和轨迹聚合解决代理SQL中的稀疏反馈问题,引入轨迹奖励和列集匹配奖励,提升多轮任务的奖励分配效率与稳定性。

Comments 17 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.15976 2026-03-18 cs.AI 83%

An Agentic Evaluation Framework for AI-Generated Scientific Code in PETSc

面向AI生成科学代码的PETSc代理评估框架

Hong Zhang, Barry Smith, Satish Balay, Le Chen, Murat Keceli, Lois Curfman McInnes, Junchao Zhang

机构 * Argonne National Laboratory(阿贡国家实验室)

专题命中 Agent评测 :agentic(title,abstract);agent(abstract);分类 cs.AI

AI总结 本文提出petscagent-bench框架,通过代理评估代理的方式,评估AI生成的科学代码在正确性、性能、代码质量等方面的表现,揭示传统指标的不足。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.08117 2026-03-18 cs.AI cs.IR 83%

UIS-Digger: Towards Comprehensive Research Agent Systems for Real-world Unindexed Information Seeking

UIS-Digger:面向现实世界未索引信息检索的综合性研究代理系统

Chang Liu, Chuqiao Kuang, Tianyi Zhuang, Yuxin Cheng, Huichi Zhou, Xiaoguang Li, Lifeng Shang

机构 * Huawei Technologies Ltd.(华为技术有限公司) The University of Hong Kong(香港大学) University College London(伦敦大学学院)

专题命中 Agent评测 :agent(title,abstract);multi-agent(abstract);分类 cs.AI

AI总结 本文提出UIS-Digger,一种新型多代理框架,通过双模式浏览和同时网页搜索与文件解析,解决未索引信息检索问题,展示了其在UIS-QA基准上的性能优势。

Comments 21 pages, 5 figures, ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.09821 2026-03-11 cs.CL 83%

One-Eval: An Agentic System for Automated and Traceable LLM Evaluation

One-Eval: 一个用于自动化和可追溯的LLM评估代理系统

Chengyu Shen, Yanheng Hou, Minghui Pan, Runming He, Zhen Hao Wong, Meiyi Qiang, Zhou Liu, Hao Liang, Peichao Lai, Zeang Sheng, Wentao Zhang

机构 * Peking University(北京大学) Beijing Institute of Technology(北京理工大学) Beijing University of Posts and Telecommunications(北京邮电大学) Zhongguancun Academy(中关村学院)

专题命中 Agent评测 :agentic(title,abstract);planning(abstract);分类 cs.CL

AI总结 One-Eval通过自动化和可追溯的评估流程,提升大语言模型评估的效率和可重复性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.06884 2026-03-10 cs.AI 83%

Distributed Legal Infrastructure for a Trustworthy Agentic Web

分布式法律基础设施用于可信代理网络

Tomer Jordi Chaffer, Victor Jiawei Zhang, Sante Dino Facchini, Botao Amber Hu, Helena Rong, Zihan Guo, Xisen Wang, Carlos Santana, Giovanni De Gasperis

机构 * Institute for Technoscience and Society(科技与社会研究所) Berkeley Center for Law & Technology(伯克利法与科技中心) U.C. Berkeley Law School(伯克利法学院) Technical University of Munich(慕尼黑技术大学) Università degli Studi dell’Aquila(阿奎拉大学) University of Oxford(牛津大学) Existential Risk Alliance(存在风险联盟) NYU Shanghai(纽约大学上海分校) Sun Yat-sen University(中山大学) Shanghai Innovation Institute(上海创新研究院) Norwegian University of Science and Technology(挪威科学技术大学)

专题命中 Agent评测 :agentic(title,abstract);agent(abstract);分类 cs.AI

AI总结 本文提出分布式法律基础设施,旨在通过可互操作的协议构建可信代理网络,实现连贯治理与合法性维持。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.01203 2026-03-09 cs.AI 83%

How Well Does Agent Development Reflect Real-World Work?

代理开发是否能反映现实世界的工作?

Zora Zhiruo Wang, Sanidhya Vijayvargiya, Aspen Chen, Hanmo Zhang, Venu Arvind Arangarajan, Jett Chen, Valerie Chen, Diyi Yang, Daniel Fried, Graham Neubig

机构 * Carnegie Mellon University(卡内基梅隆大学) Stanford University(斯坦福大学)

专题命中 Agent评测 :agent(title,abstract);AI agent(abstract);分类 cs.AI

AI总结 本文研究了代理开发与现实工作分布的匹配程度,揭示了代理开发与人类劳动力分布的不匹配,并提出了三个原则以改进基准设计。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.04902 2026-03-06 cs.CR cs.AI 83%

AgentSCOPE: Evaluating Contextual Privacy Across Agentic Workflows

AgentSCOPE: 在代理工作流中评估上下文隐私

Ivoline C. Ngong, Keerthiram Murugesan, Swanand Kadhe, Justin D. Weisz, Amit Dhurandhar, Karthikeyan Natesan Ramamurthy

机构 * University of Vermont(佛蒙特大学) IBM Research(IBM研究院)

专题命中 Agent评测 :agentic(title,abstract);agent(abstract);分类 cs.AI

AI总结 AgentSCOPE通过评估代理工作流中的隐私流,揭示了中间阶段的隐私风险,指出输出层面评估不足以反映代理系统的隐私问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.09937 2026-03-05 cs.AI cs.DC 83%

Why Do AI Agents Systematically Fail at Cloud Root Cause Analysis?

为何AI代理在云根因分析中系统性失败?

Taeyoon Kim, Woohyeok Park, Hoyeong Yun, Kyungyong Lee

机构 * Hanyang University(汉阳大学) OKESTRO Co., Ltd.(OKESTRO公司)

专题命中 Agent评测 :AI agent(title);agent(abstract);autonomous agent(abstract);分类 cs.AI

AI总结 本文分析了基于LLM的云根因分析代理在推理、通信和环境交互中的系统性故障,揭示了幻觉数据和不完全探索等普遍问题,并通过改进通信协议减少故障率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.00858 2026-03-03 econ.TH cs.AI cs.IT cs.SY eess.SY math.IT 83%

Artificial Superintelligence May be Useless: Equilibria in the Economy of Multiple AI Agents

人工超智能可能无用:多智能体经济中的均衡

Huan Cai, Ziqing Lu, Catherine Xu, Weiyu Xu, Jie Zheng

专题命中 Agent评测 :AI agent(title,abstract);agent(abstract);分类 cs.AI

AI总结 本文研究了多智能体经济中的均衡,发现除非代理能翻倍边际效用,否则不会发生购买行为,且更强大AI代理可能对低能力代理贡献零效用。

Comments 20 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.00462 2026-03-03 cs.CV cs.AI 83%

OPGAgent: An Agent for Auditable Dental Panoramic X-ray Interpretation

OPGAgent: 一种用于可审计牙科全景X光解读的智能体

Zhaolin Yu, Litao Yang, Ben Babicka, Ming Hu, Jing Hao, Anthony Huang, James Huang, Yueming Jin, Jiasong Wu, Zongyuan Ge

机构 * AIM for Health Lab Faculty of Information Technology, Monash University(信息科技学院,莫纳什大学) Monash University(莫纳什大学) Curae Health Faculty of Dentistry, The University of Hong Kong(牙科学院,香港大学) National University of Singapore(新加坡国立大学) Southeast University(东南大学)

专题命中 Agent评测 :agent(title,abstract);agentic(abstract);分类 cs.AI

AI总结 OPGAgent是一种用于可审计牙科全景X光解读的智能体系统,通过多工具协调和共识机制,在结构化报告和VQA评估中优于现有牙科VLMs和医疗智能体框架。

Comments 10 pages, 2 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.00318 2026-03-03 cs.CR cs.AI 83%

AESP: A Human-Sovereign Economic Protocol for AI Agents with Privacy-Preserving Settlement

AESP:面向AI代理的人类主权经济协议:具有隐私保护的结算

Jian Sheng Wang

专题命中 Agent评测 :AI agent(title,abstract);agent(abstract);分类 cs.AI

AI总结 AESP是一种面向AI代理的人类主权经济协议,通过五种机制确保代理在经济上具备能力但不具有主权,同时实现隐私保护和高效结算。

Comments 16 pages, 1 figure

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.22814 2026-02-27 cs.AI cs.HC 83%

When Should an AI Act? A Human-Centered Model of Scene, Context, and Behavior for Agentic AI Design

AI何时行动?面向智能体AI设计的场景、情境与行为的人本模型

Soyoung Jung, Daehoo Yoon, Sung Gyu Koh, Young Hwan Kim, Yehan Ahn, Sung Park

专题命中 Agent评测 :agentic(title,abstract);agent(abstract);分类 cs.AI

AI总结 本文提出了一种人本模型,用于设计具有情境敏感性和判断力的智能体AI系统,通过整合场景、情境和人类行为因素,指导智能体的干预行为。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.22452 2026-02-27 cs.AI cs.RO 83%

CWM: Contrastive World Models for Action Feasibility Learning in Embodied Agent Pipelines

CWM: 用于具身智能体流水线中动作可行性学习的对比世界模型

Chayan Banerjee

机构 * School of Electrical Engineering and Robotics, Queensland University of Technology(电气工程与机器人学学院,昆士兰理工大学)

专题命中 Agent评测 :agent(title,abstract);planning(abstract);分类 cs.AI

AI总结 CWM通过对比训练提升动作可行性评分,优于SFT方法,提升精度并增强安全性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.17046 2026-02-20 cs.AI 83%

Dynamic System Instructions and Tool Exposure for Efficient Agentic LLMs

动态系统指令与工具暴露用于高效代理LLM

Uria Franko

专题命中 Agent评测 :agentic(title);agent(abstract);autonomous agent(abstract);分类 cs.AI

AI总结 通过动态系统指令和工具暴露技术,ITR显著减少LLM代理的上下文令牌使用和运行成本,提升工具路由准确性,适用于长期自主代理。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.16429 2026-02-19 cs.CL 83%

TabAgent: A Framework for Replacing Agentic Generative Components with Tabular-Textual Classifiers

TabAgent:一种用表格-文本分类器替代代理生成组件的框架

Ido Levy, Eilam Shapira, Yinon Goldshtein, Avi Yaeli, Nir Mashkif, Segev Shlomov

机构 * IBM Research, Haifa, Israel(IBM研究所在以色列海法)

专题命中 Agent评测 :agentic(title,abstract);agent(abstract);分类 cs.CL

AI总结 TabAgent通过表格-文本分类器替代生成决策组件,显著降低代理系统延迟和成本,提升任务成功率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.04236 2026-02-19 cs.MA cs.AI cs.HC cs.NE 83%

Spore in the Wild: A Case Study of Spore.fun as an Open-Environment Evolution Experiment with Sovereign AI Agents on TEE-Secured Blockchains

野外的孢子:Spore.fun作为主权AI代理在TEE安全区块链上的开放环境进化实验案例研究

Botao Amber Hu, Helena Rong

机构 * Reality Design Lab(现实设计实验室) New York University Shanghai(纽约大学上海)

专题命中 Agent评测 :AI agent(title,abstract);agent(abstract);分类 cs.AI

AI总结 Spore.fun通过在TEE安全区块链上部署主权AI代理,探索开放环境实现持续开放性进化的可能性。

Comments Accepted by ALIFE 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.15039 2026-02-18 hep-ex cs.AI 83%

GRACE: an Agentic AI for Particle Physics Experiment Design and Simulation

GRACE:一个用于粒子物理实验设计和模拟的智能体

Justin Hill, Hong Joo Ryoo

机构 * Data Science Institute, Columbia Engineering(数据科学研究院,哥伦比亚工程学院) Department of Physics and Astronomy, Johns Hopkins University(物理与天文学系,约翰霍普金斯大学)

专题命中 Agent评测 :agentic(title,abstract);agent(abstract);分类 cs.AI

AI总结 GRACE是一个用于粒子物理实验设计和模拟的智能体,通过自主探索设计修改提升物理性能,引入了新的基准测试和约束搜索方法。

Comments Both authors contributed equally. 43 pages, 12 figures, 6 tables, data can be found in https://github.com/just5034/GRACE_whitepaper_data

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.12056 2026-02-13 cs.AI 83%

LawThinker: A Deep Research Legal Agent in Dynamic Environments

LawThinker: 动态环境中的一种深度法律研究代理

Xinyu Yang, Chenlong Deng, Tongyu Wen, Binyu Xie, Zhicheng Dou

机构 * Renmin University of China(中国人民大学)

专题命中 Agent评测 :agent(title,abstract);workflow(abstract);分类 cs.AI

AI总结 LawThinker是一种用于动态司法环境的自主法律研究代理,通过探索-验证-记忆策略提升法律推理的准确性和程序合规性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.11136 2026-02-13 cs.AI 83%

FormalJudge: A Neuro-Symbolic Paradigm for Agentic Oversight

FormalJudge: 一种用于代理监管的神经符号范式

Jiayi Zhou, Yang Sheng, Hantao Lou, Yaodong Yang, Jie Fu

机构 * Institute for Artificial Intelligence, Peking University(人工智能研究院,北京大学) State Key Laboratory of General Artificial Intelligence, Peking University(通用人工智能国家重点实验室,北京大学) Fudan University(复旦大学) Shanghai AI Lab(上海人工智能实验室) Shanghai Innovation Institute(上海创新研究院)

专题命中 Agent评测 :agentic(title,abstract);agent(abstract);分类 cs.AI

AI总结 FormalJudge通过神经符号框架结合形式验证,提升代理行为安全性和欺骗检测能力,实现数学保证而非概率评分。

Comments 27 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.09286 2026-02-11 cs.AI cs.CY cs.HC 83%

Human Control Is the Anchor, Not the Answer: Early Divergence of Oversight in Agentic AI Communities

人类控制是锚点而非答案:代理AI社区中的早期监管分歧

Hanjing Shi, Dominic DiFranzo

机构 * Lehigh University(莱斯利大学)

专题命中 Agent评测 :agentic(title,abstract);agent(abstract);分类 cs.AI

AI总结 本文通过分析两个代理AI社区,揭示了

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.10937 2026-02-10 cs.AI quant-ph 83%

Agent policies from higher-order causal functions

从高阶因果函数中获取智能体策略

Matt Wilson

机构 * Université Paris-Saclay(巴黎-萨克雷大学) CNRS(国家科学研究中心) ENS Paris-Saclay(巴黎-萨克雷高等师范学院) Inria(法国国家信息与自动化技术研究院) CentraleSupélec(中央超导学院) Laboratoire Méthodes Formelles(形式方法实验室)

专题命中 Agent评测 :agent(title,abstract);multi-agent(abstract);分类 cs.AI

AI总结 本文通过建立高阶因果函数与确定性POMDP策略的对应关系,揭示了人工智能、物理学基础和计算机科学逻辑之间的联系,并证明了在特定POMDP上,利用不定因果结构的策略能获得更高的奖励。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.07034 2026-02-10 cs.AI 83%

ST-Raptor: An Agentic System for Semi-Structured Table QA

ST-Raptor:一个用于半结构化表格问答的智能系统

Jinxiu Qu, Zirui Tang, Hongzhang Huang, Boyu Niu, Wei Zhou, Jiannan Wang, Yitong Song, Guoliang Li, Xuanhe Zhou, Fan Wu

机构 * Tsinghua University(清华大学)

专题命中 Agent评测 :agentic(title,abstract);agent(abstract);分类 cs.AI

AI总结 ST-Raptor通过结合视觉编辑、树形结构建模和代理驱动查询解决,提升半结构化表格问答的准确性和易用性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.17729 2026-02-05 cs.AI 83%

M^3-Bench: Multi-Modal, Multi-Hop, Multi-Threaded Tool-Using MLLM Agent Benchmark

M^3-Bench: 多模态、多跳、多线程工具使用 MLLM agent 评估基准

Yang Zhou, Mingyu Zhao, Zhenting Wang, Difei Gu, Bangwei Guo, Ruosong Ye, Ligong Han, Can Jin, Dimitris N. Metaxas

机构 * Rutgers University(新泽西罗格斯大学)

专题命中 Agent评测 :agent(title);tool use(abstract);workflow(abstract);分类 cs.AI

AI总结 M^3-Bench是首个评估多模态工具使用下模型上下文协议的基准,通过多跳、多线程工作流和可追溯的一对一对应关系,揭示了多模态大语言模型在论点保真度和结构一致性方面的持续差距。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.02995 2026-02-04 cs.AI 83%

Agent Alpha: Tree Search Unifying Generation, Exploration and Evaluation for Computer-Use Agents

Agent Alpha:通过树搜索统一生成、探索和评估计算机使用代理

Sizhe Tang, Rongqian Chen, Tian Lan

机构 * The George Washington University(乔治·华盛顿大学)

专题命中 Agent评测 :agent(title,abstract);planning(abstract);分类 cs.AI

AI总结 Agent Alpha通过步骤级MCTS统一生成、探索和评估,实现计算机使用代理的高成功率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.02564 2026-02-04 cs.LG cs.MA 83%

Label Curation Using Agentic AI

使用代理AI进行标签校准

Subhodeep Ghosh, Bayan Divaaniaazar, Md Ishat-E-Rabban, Spencer Clarke, Senjuti Basu Roy

机构 * New Jersey Institute of Technology(新泽西理工学院)

专题命中 Agent评测 :agentic(title,abstract);AI agent(abstract);分类 cs.LG

AI总结 AURA通过代理AI框架实现大规模多模态数据标注,通过概率模型联合推断真实标签和标注者可靠性,提升标注准确性并评估标注者质量。

详情

展开后加载摘要…

URL PDF HTML 收藏