arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

AI Agent

智能体、工具调用、规划、工作流、多智能体和自主任务执行。

共收录 15729 信号源:cs.AI, cs.CL, cs.LG, cs.SE

1. Agent评测 15729 篇

2608.06020 2026-08-07 cs.AI cs.LG 新提交 86%

From Economic Agents to Agentic Economies: A Systems Blueprint for Economic World Models

从经济智能体到智能体经济:经济世界模型的系统蓝图

Jiale Han, Xiang Li, Jing Qian, Wenyuan Gu, Pin Gao, Ye Luo, Hongyuan Zha, Dacheng Tao, Benyou Wang, Lin William Cong

机构 * Shenzhen Loop Area Institute(深圳河套学院) School of Data Science, The Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳)数据科学学院) University of Hong Kong(香港大学) Nanyang Technological University(南洋理工大学)

专题命中 Agent评测 :agentic(title);agent(abstract);AI agent(abstract);planning(abstract)

AI总结 本文提出经济世界模型(EWM)的六级能力阶梯实施蓝图,旨在加速可作为人类决策沙箱与AI智能体基础的下一代高保真经济模拟环境开发。

Comments Project page: https://github.com/FreedomIntelligence/Awesome-Economic-World-Models

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.02712 2026-08-05 cs.SE cs.AI 新提交 86%

Don't Regenerate, Debug: A Domain-Specific Agent for Repairing Near-Miss Hardware Operators

不要重新生成,要调试:一种用于修复近失配硬件算子的领域特定智能体

Yansong Sun, Shenxiu Wu, Siyuan Chen, Runlin Hou, Junhao Qiu, Junming Cao, Shudi Shao, Zhichao Lu, Qingfu Zhang

专题命中 Agent评测 :agent(title,abstract);workflow(abstract);agentic(abstract);分类 cs.AI、cs.SE

AI总结 该研究提出领域特定调试智能体,通过调试而非重新生成修复硬件近失配算子,其调试Pass@1准确率更高、token消耗更少,可拓展能力边界并降低成本。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.25485 2026-07-29 cs.AI cs.CL 新提交 86%

PatientAgentBench: A Benchmark Framework for Evaluating Patient-Facing Health AI Agents

PatientAgentBench:一个用于评估面向患者的健康人工智能代理的基准框架

Korosh Vatanparvar, Ashutosh Joshi, Maria Xenochristou, Mohammad Abuzar Hashemi, Prasad Kasu, Deepak Bansal, Daniel Lopez-Martinez, Anchal Nema, Ramya Ganesan, Will Kimbrough, Alex Woody, Yadunandana Rao, Dilek Hakkani-Tur, Wilko Schulz-Mahlendorf

机构 * Amazon Health AI(亚马逊健康人工智能)

专题命中 Agent评测 :AI agent(title);agent(abstract);workflow(abstract);agentic(abstract)

AI总结 研究面向患者的健康人工智能代理评估问题,核心方法是用PatientAgentBench框架,通过语言模型评审团在多维度评估,主要贡献是发现模型临床差距,发布可重复、经临床医生验证的评估标准助领域弥补差距。

Comments Code: https://github.com/amazon-science/PatientAgentBench

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.18366 2026-07-22 cs.AI cs.CL cs.CY 新提交 86%

Operational Hallucination and Safety Drift in AI Agents

人工智能代理中的操作幻觉与安全漂移

Shasha Yu, Fiona Carroll, Barry L. Bentley

专题命中 Agent评测 :AI agent(title);agent(abstract);autonomous agent(abstract);agentic(abstract)

AI总结 研究大型语言模型在多轮执行中引发的可靠性风险,通过多轮评估量化安全漂移和操作幻觉现象,分析其根源,提出行动感知监督层,该层能拦截违规行为且无良性误报,提升了代理可靠性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.13428 2026-07-22 cs.SE cs.AI 版本更新 86%

SWE-Milestone: Evaluating AI Agents on Continuous Software Evolution

EvoClaw: 评估AI代理在持续软件演化中的表现

Gangda Deng, Zhaoling Chen, Zhongming Yu, Haoyang Fan, Yuhong Liu, Yuxin Yang, Dhruv Parikh, Rajgopal Kannan, Le Cong, Mengdi Wang, Qian Zhang, Viktor Prasanna, Xiangru Tang, Xingyao Wang

机构 * USC(美国斯克利普斯大学) UCR(加州大学河滨分校) UCSD(加州大学圣地亚哥分校) Army Research Office(陆军研究办公室) Stanford(斯坦福大学) Princeton(普林斯顿大学) Haven OpenHands

专题命中 Agent评测 :AI agent(title,abstract);agent(abstract);agentic(abstract);分类 cs.AI、cs.SE

AI总结 针对现有基准测试忽视软件演化中时间依赖和技术债务的问题,提出EvoClaw基准,通过从提交日志重建可验证里程碑DAG,评估AI代理在持续开发中维持系统完整性和限制错误累积的能力。

Comments ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.11399 2026-07-14 cs.CL cs.AI 新提交 86%

Agentic Routing: The Harness-Native Data Flywheel

智能体路由:原生执行框架的数据飞轮

Xinchen Liu, Hang Zhou, Yingjie Zong, Yuchuan Tian, Liuyang Song, Shuo Zhang, Yulong Li, Wei He, Mengyu Zheng, Runke Liu, Siyang Cheng, Xiang Kuang, Hailin Hu, Kai Han, Yunhe Wang

机构 * TokenRhythm Technologies(TokenRhythm科技公司)

专题命中 Agent评测 :agentic(title,abstract);agent(abstract);tool use(abstract);分类 cs.AI、cs.CL

AI总结 研究大型语言模型智能体中模型选择问题,提出原生执行框架智能体路由范式,依执行框架状态选模型,其决策产生的数据记录形成数据飞轮,经实例化验证,表明该路由不仅控成本,更是智能体训练的数据引擎。

Comments Code: https://github.com/opensquilla/opensquilla

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.15579 2026-07-07 cs.SE cs.AI cs.CR 版本更新 86%

Don't Make Models Guess Security and Safety: Symbolic Guardrails for Domain-Specific AI Agents

领域特定智能体的符号护栏:在不牺牲效用的情况下提供更强的安全性和安全性保证

Yining Hong, Yining She, Eunsuk Kang, Christopher S. Timperley, Christian Kästner

机构 * Carnegie Mellon University(卡内基梅隆大学)

专题命中 Agent评测 :AI agent(title,abstract);agent(abstract,abstract_cn);分类 cs.AI、cs.SE

AI总结 本文研究了符号护栏在提高AI智能体安全性和安全性方面的有效性,通过系统回顾80个最新基准测试,发现74%的政策要求可通过符号护栏实现,从而在不牺牲效用的情况下提升安全性和安全性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.04532 2026-07-03 cs.CL cs.AI 版本更新 86%

Multilingual Prompt Localization for Agent-as-a-Judge: Language and Backbone Sensitivity in Requirement-Level Evaluation

多语言提示本地化用于法官-代理系统:在需求级评估中的语言与骨干敏感性

Alhasan Mahmood, Samir Abdaljalil, Hasan Kurban

机构 * Hamad Bin Khalifa University(哈马德·本·哈利法大学) Texas A&M University(德克萨斯农工大学)

专题命中 Agent评测 :agent(title,abstract);agentic(abstract);分类 cs.AI、cs.CL

AI总结 研究探讨了多语言提示在法官-代理系统评估中的影响,发现语言与骨干模型的交互作用显著,不同语言下不同模型表现各异,强调语言应作为评估变量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2409.11363 2026-06-24 cs.CL cs.AI cs.MA 版本更新 86%

CORE-Bench: Fostering the Credibility of Published Research Through a Computational Reproducibility Agent Benchmark

CORE-Bench:通过计算可重复性智能体基准提升已发表研究的可信度

Zachary S. Siegel, Sayash Kapoor, Nitya Nadgir, Benedikt Stroebl, Arvind Narayanan

机构 * Princeton University(普林斯顿大学)

专题命中 Agent评测 :agent(title,abstract);AI agent(abstract);分类 cs.AI、cs.CL

AI总结 提出CORE-Bench基准,包含270个基于90篇论文的任务,评估AI智能体在计算可重复性上的准确性,最佳智能体在最难任务上准确率仅21%,表明自动化科学任务仍有巨大提升空间。

Comments Benchmark harness and code available at http://github.com/siegelz/core-bench

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.16000 2026-06-18 cs.CL cs.LG 新提交 86%

GRACE-DS: a Guarded Reward-guided Agent Correction Environment in Data Science

GRACE-DS:数据科学中的受保护奖励引导智能体修正环境

Aleksandr Tsymbalov, Danis Zaripov, Artem Epifanov, Anastasiya Palienko

机构 * ITMO University(ITMO大学) HSE University(高等经济学院)

专题命中 Agent评测 :agent(title,abstract);planning(abstract);workflow(abstract);分类 cs.CL、cs.LG

AI总结 提出GRACE-DS,一个用于评估LLM驱动的AutoML智能体在部署前性能的隔离环境,通过隐藏的可执行验证器衡量预测性能、泄漏避免、可重复性等指标,实验证明其灵活迭代交互模式优于基线方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.15899 2026-06-16 cs.CR cs.AI cs.HC cs.LG cs.MA 新提交 86%

SkillVetBench: LLM-as-Judge for Multi-Dimensional Security Risk Evaluation in Open-Source LLM Agent Skills

SkillVetBench: 基于LLM评判的多维安全风险评估开源LLM智能体技能

Ismail Hossain, Sai Puppala, Md Jahangir Alam, Tanzim Ahad, Sajedul Talukder

机构 * SUPREME Lab, University of Texas at El Paso, Texas, USA(SUPREME实验室,德克萨斯理工大学埃尔帕索分校,德克萨斯州,美国)

专题命中 Agent评测 :agent(title,abstract);agentic(abstract);multi-agent(abstract);分类 cs.AI、cs.LG

AI总结 提出SkillVetBench,利用LLM作为评判器对开源LLM智能体技能进行多维安全风险评估,引入五维技能智能体风险评分(SARS)和CVSS v4.0向量分解,在78个恶意技能上实现零假阴性,22个良性技能上零假阳性。

Comments The main research paper is submitted to NeurIPS 2027, it is in under review

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.13994 2026-06-15 cs.CR cs.AI cs.LG 新提交 86%

Hidden in Plain Sight: Benchmarking Agent Safety Against Decomposition Attacks with DECOMPBENCH

隐于无形:使用DECOMPBENCH基准测试代理安全对抗分解攻击

Vikhyath Kothamasu, Virginia Smith, Chhavi Yadav

机构 * Carnegie Mellon University(卡内基梅隆大学) Simons Institute, UC Berkeley(Simons研究所,伯克利大学)

专题命中 Agent评测 :agent(title,abstract);tool-use(abstract);agentic(abstract);分类 cs.AI、cs.LG

AI总结 提出DeCompBench基准,通过分解攻击将有害任务拆分为良性子任务,揭示现有代理安全机制在对抗分解攻击时的脆弱性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.12925 2026-06-03 cs.SE cs.AI 86%

AgentLens: Revealing The Lucky Pass Problem in SWE-Agent Evaluation

AgentLens: 揭示 SWE-Agent 评估中的幸运通过问题

Priyam Sahoo, Gaurav Mittal, Xiaomin Li, Shengjie Ma, Benjamin Steenhoek, Pingping Lin, Yu Hu

机构 * University of Illinois, Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) Microsoft(微软)

专题命中 Agent评测 :agent(title,title_cn);分类 cs.AI、cs.SE

AI总结 针对软件工程智能体评估中仅依赖最终补丁是否通过测试的二元信号问题,提出AgentLens框架进行过程级评估,通过构建前缀树接受器参考和上下文敏感意图标注器,识别出10.7%的通过轨迹存在“幸运通过”行为,并基于质量分数将轨迹分为幸运、扎实和理想三个等级。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.26302 2026-05-27 cs.AI cs.CL cs.MA 86%

Your Agents Are Aging Too: Agent Lifespan Engineering for Deployed Systems

你的智能体也在老化:面向部署系统的智能体寿命工程

Jianing Zhu, Yeonju Ro, John Robertson, Kevin Wang, Junbo Li, Haris Vikalo, Aditya Akella, Zhangyang Wang

机构 * The University of Texas at Austin(德克萨斯大学奥斯汀分校)

专题命中 Agent评测 :agent(title,abstract);AI agent(abstract);autonomous agent(abstract);分类 cs.AI、cs.CL

AI总结 提出 AgingBench 基准,通过四种老化机制和诊断工具评估部署后智能体的可靠性退化,并指出需要寿命评估、机制级诊断和阶段针对性修复。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.17380 2026-05-19 cs.AI cs.CR cs.LG 86%

ADR: An Agentic Detection System for Enterprise Agentic AI Security

ADR:一种用于企业代理AI安全的代理检测系统

Chenning Li, Pan Hu, Justin Xu, Baris Ozbas, Olivia Liu, Caroline Van, Manxue Li, Wei Zhou, Mohammad Alizadeh, Pengyu Zhang, KK Sriramadhesikan, Ming Zhang

机构 * Uber

专题命中 Agent评测 :agentic(title,abstract);agent(abstract);AI agent(abstract);分类 cs.AI、cs.LG

AI总结 本文提出ADR系统,一种大规模、经过生产验证的企业框架,用于安全地管理通过模型上下文协议(MCP)运行的AI代理。该系统解决了三个关键问题:观测有限、鲁棒性不足和检测成本高,并通过三个组件实现了这些目标:ADR传感器、ADR探索器和ADR检测器。

Comments Accepted at MLSys 2026 (Industry Track)

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.24929 2026-04-29 cs.CL cs.AI 86%

GAIA-v2-LILT: Multilingual Adaptation of Agent Benchmark beyond Translation

GAIA-v2-LILT:超越翻译的代理基准多语言适应

Yunsu Kim, Kaden Uhlig, Joern Wuebker

机构 * LILT

专题命中 Agent评测 :agent(title,abstract);workflow(abstract);agentic(abstract);分类 cs.AI、cs.CL

AI总结 本文提出GAIA-v2-LILT,通过功能对齐、文化对齐和难度校准改进多语言代理基准,实验表明其性能提升达32.7%,接近英语表现,但仍有较大差距,揭示了多语言性能差距主要由基准测量误差引起。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.23581 2026-04-28 cs.SE cs.CL 86%

AgentEval: DAG-Structured Step-Level Evaluation for Agentic Workflows with Error Propagation Tracking

AgentEval: 基于DAG结构的步骤级评估用于具有错误传播跟踪的代理工作流

Dongxin Guo, Jikun Wu, Siu Ming Yiu

机构 * The University of Hong Kong(香港大学) Stellaris AI Limited(Stellaris AI有限公司)

专题命中 Agent评测 :agentic(title,abstract);agent(abstract);tool use(abstract);分类 cs.CL、cs.SE

AI总结 AgentEval通过构建评估有向无环图,实现对代理工作流中错误传播的精准追踪,提升故障检测召回率和根本原因准确性,适用于生产环境中的代理系统评估。

Comments Accepted at ACL 2026 Industry Track. 14 pages, 3 figures, 21 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.21652 2026-04-23 cs.AI cs.CL 86%

AstaBench: Rigorous Benchmarking of AI Agents with a Scientific Research Suite

AstaBench:通过科学研究套件严格评估AI代理

Jonathan Bragg, Mike D'Arcy, Nishant Balepur, Dan Bareket, Bhavana Dalvi, Sergey Feldman, Dany Haddad, Jena D. Hwang, Peter Jansen, Varsha Kishore, Bodhisattwa Prasad Majumder, Aakanksha Naik, Sigal Rahamimov, Kyle Richardson, Amanpreet Singh, Harshit Surana, Aryeh Tiktinsky, Rosni Vasu, Guy Wiener, Chloe Anastasiades, Stefan Candra, Jason Dunkelberger, Dan Emery, Rob Evans, Malachi Hamada, Regan Huff, Rodney Kinney, Matt Latzke, Jaron Lochner, Ruben Lozano-Aguilera, Cecile Nguyen, Smita Rao, Amber Tanaka, Brooke Vlahos, Peter Clark, Doug Downey, Yoav Goldberg, Ashish Sabharwal, Daniel S. Weld

机构 * Asta Team, Allen Institute for AI(Asta团队,人工智能研究所) University of Maryland(马里兰大学) University of Arizona(亚利桑那大学) University of Zurich(苏黎世大学) Bar-Ilan University(巴伊兰大学) University of Washington(华盛顿大学)

专题命中 Agent评测 :AI agent(title,abstract);agent(abstract);agentic(abstract);分类 cs.AI、cs.CL

AI总结 本文提出AstaBench,通过2400多个科学问题全面评估AI代理能力,提供生产级搜索工具和九种科学优化的代理类,揭示AI在科学研究辅助方面仍存在显著差距。

Comments Published as a conference paper at ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.05523 2026-04-20 cs.SE cs.AI 86%

Capture the Flags: Family-Based Evaluation of Agentic LLMs via Semantics-Preserving Transformations

捕获旗帜:通过语义保持变换进行基于家庭的代理LLM评估

Shahin Honarvar, Amber Gorzynski, James Lee-Jones, Harry Coppock, Marek Rei, Joseph Ryan, Alastair F. Donaldson

机构 * Department of Computing, Imperial College London(帝国理工学院伦敦计算机系) AI Security Institute(人工智能安全研究所) Royal Grammar School Guildford(格里菲斯皇家文法学校)

专题命中 Agent评测 :agentic(title,abstract);agent(abstract);tool use(abstract);分类 cs.AI、cs.SE

AI总结 本文提出CTF挑战家族,通过语义保持的程序变换生成等效挑战,评估代理鲁棒性和泛化能力,展示了Evolve-CTF工具及13种代理LLM配置的评估结果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.12213 2026-04-16 cs.AI cs.MA cs.SE 86%

Modality-Native Routing in Agent-to-Agent Networks: A Multimodal A2A Protocol Extension

代理到代理网络中的模态本原路由:一种多模态A2A协议扩展

Vasundra Srinivasan

机构 * AI Architect, Author—Data Engineering for Multimodal AI (O’Reilly)(人工智能架构师,作者—多模态AI的数据工程(O’Reilly)) Stanford School of Engineering (April 2026)(斯坦福大学工程学院(2026年4月))

专题命中 Agent评测 :agent(title,abstract);multi-agent(abstract);分类 cs.AI、cs.SE

AI总结 本文提出MMA2A架构,通过多模态本原路由提升任务准确率,其在跨模态任务中表现优于文本瓶颈基线,尤其在视觉依赖任务中效果显著,但增加了1.8倍的延迟。

Comments 14 pages, 4 figures (TikZ). PDFLaTeX. Supplementary code and experiment artifacts: https://github.com/vasundras/modality-native-routing-a2a-protocol

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.03486 2026-04-09 cs.HC cs.AI cs.CV cs.LG cs.MA 86%

VisionClaw: Always-On AI Agents through Smart Glasses

VisionClaw:通过智能眼镜实现始终在线的AI代理

Xiaoan Liu, DaeHo Lee, Eric J Gonzalez, Mar Gonzalez-Franco, Ryo Suzuki

机构 * University of Colorado Boulder(科罗拉多大学博尔德分校) Gwangju Institute of Science and Technology(光州科学技术院) Google(谷歌)

专题命中 Agent评测 :AI agent(title,abstract);agent(abstract);agentic(abstract);分类 cs.AI、cs.LG

AI总结 VisionClaw通过智能眼镜实现始终在线的AI代理,结合实时第一视角感知与任务执行,支持语音驱动的任务启动与委托,提升任务完成效率和交互体验。

Comments 17 pages, 11 figures, plus appendix

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.00356 2026-04-02 cs.AI cs.CL 86%

Signals: Trajectory Sampling and Triage for Agentic Interactions

信号:代理互动的轨迹采样与优先级排序

Shuguang Chen, Adil Hafeez, Salman Paracha

机构 * DigitalOcean Holdings, Inc.(DigitalOcean控股公司)

专题命中 Agent评测 :agentic(title,abstract);agent(abstract);planning(abstract);分类 cs.AI、cs.CL

AI总结 本文提出基于信号的轻量框架,用于高效筛选代理交互轨迹,通过计算低成本信号提升采样效率,实验证明其在不同任务中均能有效提升信息量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.00189 2026-04-02 cs.SE cs.AI cs.NI 86%

Making Sense of AI Agents Hype: Adoption, Architectures, and Takeaways from Practitioners

解析AI代理 hype:采用、架构与从业者洞察

Ruoyu Su, Matteo Esposito, Roberta Capuano, Rafiullah Omar, June Sallou, Henry Muccini, Davide Taibi

机构 * University of Oulu(奥卢大学) University of L’Aquila(拉奎拉大学) Wageningen University(瓦赫宁根大学) University of Southern Denmark(南丹麦大学)

专题命中 Agent评测 :AI agent(title,abstract);agent(abstract);agentic(abstract);分类 cs.AI、cs.SE

AI总结 本文通过分析138场从业者会议演讲,探讨了企业如何采用基于代理的架构,识别常见架构策略及模式,并分析了LLM驱动代理系统在应用领域和技术实现中的使用情况。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.26221 2026-03-30 cs.CR cs.AI cs.ET cs.SE 86%

Clawed and Dangerous: Can We Trust Open Agentic Systems?

带刺且危险:我们能信任开放代理系统吗?

Shiping Chen, Qin Wang, Guangsheng Yu, Xu Wang, Liming Zhu

机构 * CSIRO Data61(澳大利亚联邦科学与工业研究组织Data61) University of Technology Sydney(悉尼科技大学)

专题命中 Agent评测 :agentic(title,abstract);agent(abstract);planning(abstract);分类 cs.AI、cs.SE

AI总结 本文探讨开放代理系统在安全治理中的挑战,提出六维分析框架和安全建设参考原则,指出当前在部署控制、运营治理等方面存在不足。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.22529 2026-03-25 cs.CV cs.AI cs.CL 86%

Ego2Web: A Web Agent Benchmark Grounded in Egocentric Videos

Ego2Web:一种基于第一人称视频的网络代理基准测试

Shoubin Yu, Lei Shu, Antoine Yang, Yao Fu, Srinivas Sunkara, Maria Wang, Jindong Chen, Mohit Bansal, Boqing Gong

机构 * Google DeepMind(谷歌DeepMind) UNC Chapel Hill(北卡罗来纳大学教堂山分校)

专题命中 Agent评测 :agent(title,abstract);AI agent(abstract);planning(abstract);分类 cs.AI、cs.CL

AI总结 Ego2Web通过结合真实世界第一人称视频与网络任务,解决网络代理在现实物理环境中的感知问题,提出LLM-as-a-Judge评估方法,揭示当前代理在视觉理解和任务规划上的不足。

Comments CVPR 2026. Project page: https://ego2web.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.19583 2026-03-23 cs.SE cs.AI 86%

Skilled AI Agents for Embedded and IoT Systems Development

嵌入式与物联网系统开发中的技能型AI代理

Yiming Li, Yuhan Cheng, Mingchen Ma, Yihang Zou, Ningyuan Yang, Wei Cheng, Hai "Helen" Li, Yiran Chen, Tingjun Chen

机构 * Department of Electrical and Computer Engineering, Duke University(杜克大学电气与计算机工程系)

专题命中 Agent评测 :AI agent(title,abstract);agent(abstract);agentic(abstract);分类 cs.AI、cs.SE

AI总结 本文提出技能型AI代理框架与IoT-SkillsBench基准,通过实测验证,展示结构化专家知识在嵌入式编程中的高效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.08329 2026-03-10 cs.CL cs.AI cs.IR 86%

SPD-RAG: Sub-Agent Per Document Retrieval-Augmented Generation

SPD-RAG:基于文档的子代理检索增强生成

Yagiz Can Akay, Muhammed Yusuf Kartal, Esra Alparslan, Faruk Ortakoyluoglu, Arda Akpinar

机构 * TOBB University of Economics and Technology(托布大学经济与技术学院) OSTIM Technical University(OSTIM技术大学)

专题命中 Agent评测 :agent(title,abstract);agentic(abstract);multi-agent(abstract);分类 cs.AI、cs.CL

AI总结 SPD-RAG通过文档级子代理和集中融合提升多文档问答性能,实现高效检索与生成。

Comments 12 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.00472 2026-03-03 cs.AI cs.SE 86%

From Goals to Aspects, Revisited: An NFR Pattern Language for Agentic AI Systems

从目标到方面,重新审视:面向智能体AI系统的NFR模式语言

Yijun Yu

机构 * The Open University(开放大学)

专题命中 Agent评测 :agentic(title,abstract);agent(abstract);autonomous agent(abstract);分类 cs.AI、cs.SE

AI总结 本文提出面向智能体AI系统的NFR模式语言,通过目标驱动的方法系统发现和模块化交叉切面问题,提升系统可靠性。

Comments 12 pages, submitted

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.08765 2026-02-10 cs.SE cs.AI 86%

Taming Scylla: Understanding the multi-headed agentic daemon of the coding seas

驯服斯基拉:理解编码海洋中的多头代理守护程序

Micah Villmow

专题命中 Agent评测 :agentic(title,abstract);agent(abstract);multi-agent(abstract);分类 cs.AI、cs.SE

AI总结 本文提出Scylla框架,用于评估代理编码工具,通过结构化消融研究量化复杂性和效率的权衡,表明架构复杂性不总是提升质量。

Comments 32 Pages, 7 Figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.02395 2026-02-03 cs.LG cs.AI cs.CR cs.MA 86%

David vs. Goliath: Verifiable Agent-to-Agent Jailbreaking via Reinforcement Learning

大卫与歌利亚:通过强化学习实现可验证的代理到代理劫持

Samuel Nellessen, Tal Kachman

机构 * Department of Artificial Intelligence, Radboud University, Nijmegen, The Netherlands(人工智能系,拉德堡德大学,尼姆韦根,荷兰)

专题命中 Agent评测 :agent(title);autonomous agent(abstract);tool use(abstract);agentic(abstract)

AI总结 通过强化学习框架Slingshot,验证了Tag-Along攻击作为可验证的威胁模型,并展示了如何通过环境交互从现成模型中引发有效代理攻击。

Comments Under review. 8 main pages, 2 figures, 2 tables. Appendix included

详情

展开后加载摘要…

URL PDF HTML 收藏