arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

AI Agent

智能体、工具调用、规划、工作流、多智能体和自主任务执行。

共收录 15819 信号源:cs.AI, cs.CL, cs.LG, cs.SE

1. Agent评测 15819 篇

2605.16194 2026-05-18 cs.DL cs.AI cs.IR cs.MA 79%

paper.json: A Coordination Convention for LLM-Agent-Actionable Papers

为LLM-代理可操作论文的协调约定

Arquimedes Canedo

机构 * arquicanedo

专题命中 Agent评测 :agent(title,abstract);分类 cs.AI

AI总结 本文提出paper.json文件,通过稳定声明ID、明确不声明列表、精确图示命令和稳定定义ID等约定,解决LLM代理在阅读学术论文时的重复失败问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.15710 2026-05-18 cs.CL 79%

SMMBench: A Benchmark for Source-Distributed Multimodal Agent Memory

SMMBench:一种用于源分布多模态智能体记忆的基准测试

Huacan Chai, Yukai Wang, Yingxuan Yang, Dan Peng, Yuanyi Song, Zhihui Fu, Weiwen Liu, Jianghao Lin, Jun Wang, Weinan Zhang

机构 * Shanghai Jiao Tong University, China(上海交通大学,中国) OPPO, China(OPPO,中国)

专题命中 Agent评测 :agent(title,abstract);分类 cs.CL

AI总结 SMMBench旨在评估智能体在多源分布证据下进行多模态推理、冲突解决和行动预测的能力,揭示当前系统在处理碎片化异构数据时的不足。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.15537 2026-05-18 cs.AI 79%

RTL-BenchMT: Dynamic Maintenance of RTL Generation Benchmark Through Agent-Assisted Analysis and Revision

RTL-BenchMT:通过代理辅助分析和修订动态维护RTL生成基准

Jing Wang, Shang Liu, Hangan Zhou, Zhiyao Xie

机构 * Hong Kong University of Science and Technology(香港科技大学)

专题命中 Agent评测 :agent(title);agentic(abstract);分类 cs.AI

AI总结 本文提出RTL-BenchMT框架,通过自动识别和修正错误案例及检测更新过拟合案例,解决RTL基准中的缺陷和过拟合问题,降低人工维护成本。

Comments This paper has been accepted by DAC 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.14556 2026-05-15 cs.AI 79%

TeachAnything: A Multimodal Crowdsourcing Platform for Training Embodied AI Agents in Symmetrical Reality

教任何事物:一种多模态众包平台,用于在对称现实中的训练具身AI代理

Zidong Liu, Rongkai Liu, Yue Li, Zhenliang Zhang

机构 * State Key Laboratory of General Artificial Intelligence(通用人工智能国家重点实验室) BIGAI

专题命中 Agent评测 :AI agent(title);agent(abstract);分类 cs.AI

AI总结 本文提出TeachAnything平台,通过多模态示范信号整合三阶段示范范式,实现跨场景、任务和具身的多样化示范数据收集,为对称现实中的具身AI代理开发提供实用基础。

Comments 5 pages, 3 figures. Accepted as an IEEE VR 2026 Poster

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.14016 2026-05-15 cs.SE cs.SD 79%

Case Studies and Reflections on Agentic Software Engineering for Rapid Development of Digital Music Instruments

代理软件工程在快速开发数字音乐乐器中的案例研究与反思

Matthew John Yee-King

机构 * Computing, Goldsmiths(Goldsmiths 计算学系)

专题命中 Agent评测 :agentic(title,abstract);分类 cs.SE

AI总结 本文通过三个案例研究展示代理软件工程在开发数字音乐乐器中的应用,探讨其降低入门门槛和提升软件兼容性与可持续性的潜力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.01847 2026-05-15 cs.AI 79%

NeuroState-Bench: A Human-Calibrated Benchmark for Commitment Integrity in LLM Agent Profiles

NeuroState-Bench:一个用于LLM代理配置承诺完整性的校准基准

Xiao Jia

机构 * School of Artificial Intelligence(人工智能学院) The Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳))

专题命中 Agent评测 :agent(title,abstract);分类 cs.AI

AI总结 NeuroState-Bench通过定义的侧查询探针而非隐激活来操作承诺完整性,包含144个确定性任务和306个侧查询探针,通过人类校准验证任务成功与承诺完整性之间的差异。

Comments 30 pages, 11 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.13044 2026-05-14 cs.CR cs.AI 79%

No Attack Required: Semantic Fuzzing for Specification Violations in Agent Skills

无需攻击:用于代理技能规范违规的语义模糊测试

Ying Li, Hongbo Wen, Yanju Chen, Hanzhi Liu, Yuan Tian, Yu Feng

机构 * University of California, San Diego(加州大学圣迭戈分校)

专题命中 Agent评测 :agent(title,abstract);分类 cs.AI

AI总结 本文提出Sefz框架,通过语义模糊测试发现代理技能中的规范违规问题,揭示了安全规则漏洞对用户信任的影响。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.10531 2026-05-12 cs.AI 79%

A Reflective Storytelling Agent for Older Adults: Integrating Argumentation Schemes and Argument Mining in LLM-Based Personalised Narratives

为老年人设计的反思性叙事代理:在基于LLM的个性化叙事中整合论证方案和论证挖掘

Jayalakshmi Baskar, Vera C. Kaelin, Kaan Kilic, Helena Lindgren

机构 * Umeå University, Department of Computing Science(乌尔姆大学计算机科学系)

专题命中 Agent评测 :agent(title,abstract);分类 cs.AI

AI总结 本研究探讨了基于知识驱动的LLM叙事是否能支持老年人与数字伴侣的有意义互动。通过整合知识图谱、用户建模、论证理论和论证挖掘,系统在生成叙事时提供指导和检查。研究发现,论证质量与清晰度相关,文化相关性影响使用意愿,而高幻觉风险指标的叙事常被感知为不一致。

Comments Submitted to ACM Transactions on Intelligent Systems and Technology (TIST)

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.10448 2026-05-12 cs.AI 79%

Can Agent Benchmarks Support Their Scores? Evidence-Supported Bounds for Interactive-Agent Evaluation

代理基准能否支持其分数?基于证据的交互代理评估的边界

Shanshan Gao, Liyi Zhou

机构 * The University of Sydney(悉尼大学)

专题命中 Agent评测 :agent(title,abstract);分类 cs.AI

AI总结 本文提出一种证据报告层,通过验证存储的艺术品来提高交互代理评估的可靠性,明确区分不同失败模式。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.22953 2026-05-12 cs.AI 79%

General Agent Evaluation

通用智能体评估

Elron Bandel, Asaf Yehudai, Lilach Eden, Yehoshua Sagron, Yotam Perlitz, Elad Venezian, Natalia Razinkov, Natan Ergas, Shlomit Shachor Ifergan, Segev Shlomov, Michal Jacovi, Leshem Choshen, Liat Ein-Dor, Yoav Katz, Michal Shmueli-Scheuer

机构 * IBM Research(IBM研究院) MIT(麻省理工学院)

专题命中 Agent评测 :agent(title,abstract);分类 cs.AI

AI总结 本文系统评估了通用智能体在不同协议和环境下的性能,提出统一协议和评估框架,揭示了智能体架构和基础模型对性能的影响,发现通用智能体无需定制即可适应多种领域。

Comments Presented at the ICLR 2026 Workshop on Agents in the Wild

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.07313 2026-05-11 cs.AI 79%

When Stored Evidence Stops Being Usable: Scale-Conditioned Evaluation of Agent Memory

当存储的证据不再可用:基于规模的代理记忆评估

Jiaqi Shao, Yiyi Lu, Yunzhen Zhang, Bing Luo

机构 * Hong Kong University of Science and Technology(香港科技大学) Duke Kunshan University(杜克昆山大学)

专题命中 Agent评测 :agent(title,abstract);分类 cs.AI

AI总结 本文提出了一种基于规模的代理记忆评估方法,用于评估记忆在无关会话积累时的可靠性变化,展示了不同记忆系统在不同规模下的表现差异。

Comments 19 pages, 11 figures, preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.07180 2026-05-11 cs.CL 79%

Learning Agent Routing From Early Experience

从早期经验学习代理路由

Yimin Wang, Jiahao Qiu, Xuan Qi, Xinzhe Juan, Jingzhe Shi, Zelin Zhao, Hongru Wang, Shilong Liu, Mengdi Wang

机构 * AI Lab, Princeton University(普林斯顿大学人工智能实验室) University of Michigan(密歇根大学) Institute for Interdisciplinary Information Sciences (IIIS), Tsinghua University(清华大学交叉信息学院) Shanghai Jiao Tong University(上海交通大学) University of Edinburgh(爱丁堡大学) King’s College London(伦敦国王学院)

专题命中 Agent评测 :agent(title,abstract);分类 cs.CL

AI总结 本文研究在冷启动条件下如何在轻量级LLM推理与完整代理执行间进行路由,提出无需训练的BoundaryRouter框架,通过早期行为经验和指导性推理决定是否直接使用LLM还是升级至代理,实验显示其在降低推理时间与提升性能方面优于其他方法。

Comments 17 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.07073 2026-05-11 cs.AI 79%

TeamBench: Evaluating Agent Coordination under Enforced Role Separation

TeamBench: 在强制角色分离下评估代理协调

Yubin Kim, Chanwoo Park, Taehan Kim, Eugene Park, Samuel Schmidgall, Salman Rahman, Chunjong Park, Cynthia Breazeal, Xin Liu, Hamid Palangi, Hae Won Park, Daniel McDuff

机构 * MIT(麻省理工学院) Google Research(谷歌研究院) Google DeepMind(谷歌DeepMind) Independent Researcher(独立研究者)

专题命中 Agent评测 :agent(title,abstract);分类 cs.AI

AI总结 TeamBench通过851个任务模板和931个预设实例,评估在操作系统强制角色分离下代理协调的能力,发现提示仅和沙盒强制团队的通过率无显著差异,但提示仅团队更易出现验证者篡改执行者代码的情况。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.07011 2026-05-11 cs.LG 79%

Dual-Agent Co-Training for Health Coaching via Implicit Adversarial Preference Optimization

双代理协同训练用于健康教练的隐式对抗偏好优化

Da Long, Lingyi Fu, Diya Michelle Rao, Jasmine Ruales Carrera, Yang Bai, Shandian Zhe

机构 * Kahlert School of Computing University of Utah(Utah大学计算学院Kahlert学院) Department of Health and Kinesiology University of Utah(健康与运动科学系Utah大学)

专题命中 Agent评测 :agent(title,abstract);分类 cs.LG

AI总结 本文提出双代理框架,通过隐式对抗偏好优化提升健康教练质量,改进对话和模拟器训练。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.02934 2026-05-11 cs.SE 79%

AgenticSZZ: Temporal Knowledge Graph-Guided Agentic Bug-Inducing Commit Identification

AgenticSZZ: 基于时间知识图谱的代理式Bug引发提交识别

Yu Shi, Hao Li, Bram Adams, Ahmed E. Hassan

专题命中 Agent评测 :agentic(title);agent(abstract);分类 cs.SE

AI总结 本文提出AgenticSZZ,利用时间知识图谱改进Bug引发提交识别,通过构建包含时间与结构关系的知识图谱,并结合LLM代理进行图搜索,提升识别精度与效果。

Comments Add RQ3 with open-source LLMs evaluation, such as DeepSeek-V4-Pro

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.05379 2026-05-08 cs.AI cs.CC cs.ET 79%

Partial Evidence Bench: Benchmarking Authorization-Limited Evidence in Agentic Systems

部分证据基准:在代理系统中受授权限制的证据基准测试

Krti Tallam

机构 * KamiwazaAI

专题命中 Agent评测 :agentic(title);agent(abstract);分类 cs.AI

AI总结 本文提出Partial Evidence Bench,用于评估代理系统在授权限制下的证据处理能力,通过四个维度评估系统表现,展示不同行为模式对完成度的影响。

Comments Benchmark paper with deterministic synthetic corpora, 14 pages, 6 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.17573 2026-05-08 cs.AI 79%

Beyond Static Snapshots: A Grounded Evaluation Framework for Language Models at the Agentic Frontier

超越静态快照:语言模型在代理前沿的 grounded 评估框架

Jazmia Henry

机构 * University of Oxford(牛津大学)

专题命中 Agent评测 :agentic(title,abstract);分类 cs.AI

AI总结 本文提出 grounded continuous evaluation 框架,通过 deterministic verifier 和 CPU 更新 LoRA adapters,解决 reward hacking 和硬件限制问题,并在多个架构和领域验证其有效性。

Comments Submitted for consideration to NeurIPS 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.01604 2026-05-05 cs.AI 79%

Evaluating Agentic AI in the Wild: Failure Modes, Drift Patterns, and a Production Evaluation Framework

在真实环境中评估代理AI:故障模式、漂移模式及生产评估框架

Mukund Pandey

机构 * Independent Researcher(独立研究者)

专题命中 Agent评测 :agentic(title,abstract);分类 cs.AI

AI总结 本文针对代理AI在生产环境中持续运行时的评估挑战,提出七种故障模式分类及PAEF框架,揭示传统指标在检测故障模式上的不足。

Comments 11 pages, 6 tables, 1 figure. Reference implementation: https://github.com/mukund1985/llm-eval-toolkit

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.01209 2026-05-05 cs.SE cs.FL 79%

ClarifySTL: An Interactive LLM Agent Framework for STL Transformation through Requirements Clarification

ClarifySTL: 一种通过需求澄清的交互式LLM代理框架用于STL转换

Yue Fang, Zhi Jin, Jie An, Hongshen Chen, Xiaohong Chen, Naijun Zhan

专题命中 Agent评测 :agent(title,abstract);分类 cs.SE

AI总结 本文提出ClarifySTL框架,通过交互式澄清需求中的模糊和歧义信息,提升STL转换的准确性与效率,实验表明其在多个基准测试中表现优异。

Comments 32 pages, 15 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.00383 2026-05-04 cs.CL 79%

Agentic AI for Substance Use Education: Integrating Regulatory and Scientific Knowledge Sources

代理AI用于物质使用教育:整合监管与科学知识源

Kosar Haghani, Zahra Kolagar, Mohammed Atiquzzaman

机构 * Department of Social Science, Texas Woman's University(德克萨斯女子大学社会科学系) Department of Computer Science, Augsburg University of Applied Sciences(应用科学大学计算机科学系) School of Computer Science, University of Oklahoma(俄克拉荷马大学计算机科学学院)

专题命中 Agent评测 :agentic(title,abstract);分类 cs.CL

AI总结 本文提出一种基于代理的AI系统,结合监管数据与科学文献,提供实时、权威的物质使用教育,通过专家评估验证其准确性与适用性。

Comments 22 pages, 6 figures, 2 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.00314 2026-05-04 cs.CR cs.AI cs.PL 79%

Semia: Auditing Agent Skills via Constraint-Guided Representation Synthesis

Semia:通过约束引导的表示合成审计代理技能

Hongbo Wen, Ying Li, Hanzhi Liu, Chaofan Shou, Yanju Chen, Yuan Tian, Yu Feng

机构 * University of California, Santa Barbara(加州大学圣芭芭拉分校) University of California, Los Angeles(加州大学洛杉矶分校) University of California, San Diego(加州大学圣地亚哥分校)

专题命中 Agent评测 :agent(title,abstract);分类 cs.AI

AI总结 Semia通过约束引导的表示合成技术,对代理技能进行静态审计,发现超过一半的技能存在关键语义风险,其召回率和F1值显著优于传统方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.28093 2026-05-01 cs.AI 79%

What Makes a Good Terminal-Agent Benchmark Task: A Guideline for Adversarial, Difficult, and Legible Evaluation Design

什么样的终端-智能体基准任务是好的:为对抗性、困难和可理解的评估设计提供指南

Ivan Bercovich

专题命中 Agent评测 :agent(title,abstract);分类 cs.AI

AI总结 本文探讨了如何设计有效的终端-智能体基准任务,指出任务应具备对抗性、难度和可理解性,以避免常见的失败模式,并通过实证证据表明超过15%的基准任务存在奖励可 hack 的问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.28049 2026-05-01 cs.AI 79%

Agent-Agnostic Evaluation of SQL Accuracy in Production Text-to-SQL Systems

不依赖代理的生产环境SQL准确性评估

Taslim Jamal Arif, Kuldeep Singh

专题命中 Agent评测 :agent(title,abstract);分类 cs.AI

AI总结 本文提出STEF框架,通过自然语言输入和生成的SQL进行生产环境文本到SQL系统的评估,无需数据库模式或参考查询,实现持续监控和改进反馈。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.27849 2026-05-01 cs.AI 79%

A Grid-Aware Agent-Based Model for Analyzing Electric Vehicle Charging Systems

一种面向电网的基于代理的模型用于分析电动汽车充电系统

Khalil Al-Rahman Youssefi, Marija Gojkovic, Walter Stefanutti, Mika Auer, Melanie Schranz

机构 * Lakeside Labs(拉克西德实验室) Silicon Austria Labs(硅 Austria 实验室)

专题命中 Agent评测 :agent(title,abstract);分类 cs.AI

AI总结 本文提出一种可配置的、面向电网的基于代理的模型,用于系统分析电动汽车充电系统在可配置基础设施和运营条件下的表现,通过整合异构的电动汽车行为、充电柱约束和共享的能源沙盒,研究用户导向的充电动态和设施层面的电力行为。

Comments This is the author's version of a paper submitted to SIMULTECH. 12 Pages, 1 Table, 10 Figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.27820 2026-05-01 cs.AI cs.DB cs.IR cs.MA 79%

ObjectGraph: From Document Injection to Knowledge Traversal -- A Native File Format for the Agentic Era

ObjectGraph:从文档注入到知识遍历——面向代理时代的原生文件格式

Mohit Dubey, Open Gigantic

机构 * Open Gigantic(开放巨型)

专题命中 Agent评测 :agentic(title);agent(abstract);分类 cs.AI

AI总结 本文提出ObjectGraph文件格式,通过将文档视为类型化有向知识图谱而非文本字符串,解决代理任务中文档处理的效率与准确性问题,实现95.3%的token减少和98.7%的内容保留。

Comments 12 pages, 4 figures, 4 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.27725 2026-05-01 cs.HC cs.AI 79%

AgentEconomist: An End-to-end Agentic System Translating Economic Intuitions into Executable Computational Experiments

AgentEconomist:一个端到端的代理系统,将经济直觉转化为可执行的计算实验

Jiaju Chen, Jinghua Piao, Xia Xu, Songwei Li, Tong Xia, Xiangnan He, Yong Li

机构 * Zhongguancun Academy(中关村学院) University of Science and Technology of China(中国科学技术大学) Department of Electronic Engineering, Tsinghua University(清华大学电子工程系) Vanke School of Public Health, Tsinghua University(清华大学万科公共卫生学院)

专题命中 Agent评测 :agentic(title);workflow(abstract);分类 cs.AI

AI总结 AgentEconomist通过模块化多阶段架构,将经济直觉转化为可执行的计算实验,通过文献基础假设生成、实验设计和执行阶段,结合人类与AI协作,提升研究创新性与文献相关性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.26958 2026-05-01 cs.CY cs.AI 79%

Designing Ethical Learning for Agentic AI: Toegye Yi Hwang's Ethical Emotion Regulation Framework

为智能代理AI设计道德学习:Toegye Yi Hwang的道德情感调节框架

Ji Yeon Kim

机构 * Seoul National University(首尔国立大学)

专题命中 Agent评测 :agentic(title,abstract);分类 cs.AI

AI总结 本文提出一种基于Toegye Yi Hwang道德哲学的智能代理AI道德情感调节框架,通过五阶段架构和评估工具规范自主决策周期中的道德情感过程。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.23283 2026-04-28 cs.LG 79%

Revisable by Design: A Theory of Streaming LLM Agent Execution

为设计而可逆:流式LLM代理执行的理论

Zhiyuan Zhai, Ming Li, Xin Wang

机构 * Fudan University(复旦大学) Guangming Lab(光明实验室)

专题命中 Agent评测 :agent(title,abstract);分类 cs.LG

AI总结 本文提出流式LLM代理执行的可逆性理论,通过定义可逆性分类,证明冲突可逆动作导致不可满足性,提出修订吸收器算法提升执行灵活性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.22871 2026-04-28 cs.CR cs.AI cs.MA 79%

AutoRISE: Agent-Driven Strategy Evolution for Red-Teaming Large Language Models

AutoRISE:面向大语言模型的代理驱动策略进化

Tanmay Gautam, Alireza Bahramali, Sandeep Atluri

机构 * Responsible AI, Microsoft(微软责任人工智能)

专题命中 Agent评测 :agent(title,abstract);分类 cs.AI

AI总结 本文提出AutoRISE,通过代理编辑攻击策略并评估,实现攻击策略的进化,提升了对抗成功率。

Comments 36 pages, 6 tables, 2 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.21480 2026-04-24 cs.AI 79%

Efficient Agent Evaluation via Diversity-Guided User Simulation

通过多样性引导的用户模拟实现高效的代理评估

Itay Nakash, George Kour, Ateret Anaby-Tavor

机构 * IBM Research(IBM研究院)

专题命中 Agent评测 :agent(title,abstract);分类 cs.AI

AI总结 本文提出DIVERT框架,通过快照和覆盖引导的方式高效探索代理与用户交互,提升评估效率和覆盖范围。

详情

展开后加载摘要…

URL PDF HTML 收藏