arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

AI Agent

智能体、工具调用、规划、工作流、多智能体和自主任务执行。

2026-08-31 至 2026-08-31 共收录 175 信号源:cs.AI, cs.CL, cs.LG, cs.SE

1. 软件智能体 11 篇

2608.28497 2026-08-31 cs.SE cs.AI 新提交 84%

On the Maintenance and Co-evolution of Agent Plugins: An Empirical Study of Claude Code Plugin Marketplaces

智能体插件的维护与协同演化:Claude Code插件市场的实证研究

Ahmed Hereiz, Yingzhe Lyu, Hao Li, Bram Adams, Ahmed E. Hassan

专题命中 软件智能体 :agent(title,abstract);tool use(abstract);分类 cs.AI、cs.SE

AI总结 本研究通过对Claude Code插件市场的实证分析,揭示智能体插件的维护与协同演化规律,发现其功能驱动开发特征及新型组件耦合依赖关系。

Comments Under review

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.27549 2026-08-31 cs.CV 新提交 82%

Code as Worlds: Agentic Discovery of Executable World Representations for Physical Reasoning

代码即世界:用于物理推理的可执行世界表征的智能体式发现

Hanyang Wang, Yimo Cai, Weiliang Chen, Jiawei Chi, Haowen Sun, Qiyu Dai, Yi-Hsin Hung, Xingzhuo Guo, Jinshan Ren, Runmao Yao, Ziwei Liu, Mingsheng Long, Yueqi Duan, Jun Gao, Jiangran Lyu, Fangfu Liu, Jialong Wu

机构 * MirroS

专题命中 软件智能体 :agentic(title,abstract);agent(abstract)

AI总结 本研究提出Code-as-World范式,通过智能体式发现循环构建可执行世界表征,将其用于为视觉-语言模型训练提供物理监督,在QuantiPhy数据集上取得最优性能且超越领先专有模型

Comments Project Page: this https URL (https://mirros-lab.github.io/code-as-world)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.27902 2026-08-31 cs.CL cs.AI 新提交 81%

LandingAgent: A Reference-Annotated Dataset and Agentic Generation Framework for Landing Pages

LandingAgent:用于落地页的参考标注数据集与智能体生成框架

Injun Baek, HyeongSeok Lee, Yearim Kim, Junhoo Lee, Nojun Kwak

机构 * Seoul National University(首尔大学) Samsung Electronics(三星电子)

专题命中 软件智能体 :agentic(title,abstract);分类 cs.AI、cs.CL

AI总结 针对落地页生成中通用模板与无依据主张的问题,本文提出智能体框架LandingAgent,结合参考标注数据集LandingBench,实验验证其在目标适配性、呈现质量等方面优于直接生成方法。

Comments 30 pages, 8 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.25202 2026-08-31 cs.SE cs.AI 版本更新 79%

SpecMine: A Large-Scale Corpus of Spec-Driven Development Artifacts

SPECMINE:一个大规模的规范驱动开发制品语料库

Shyam Agarwal, Bogdan Vasilescu

机构 * Carnegie Mellon University(卡内基梅隆大学)

专题命中 软件智能体 :agent(abstract);AI agent(abstract);workflow(abstract);分类 cs.AI、cs.SE

AI总结 SPECMINE是一个大规模语料库,通过两次普查收集公共GitHub仓库中的规范驱动开发制品,含大量文件、PR及引用数据,助力研究AI智能体时代软件的规范过程。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.27790 2026-08-31 cs.AI cs.DB 新提交 74%

Credo: Reusable Declarative Primitives for Agentic Workflows

Credo:面向智能体工作流的可复用声明式原语

Duo Lu, Andrew Crotty, Uğur Çetintemel

机构 * Brown University(布朗大学) Northwestern University(西北大学)

专题命中 软件智能体 :agentic(title);分类 cs.AI

AI总结 Credo可恢复智能体工作流harness的结构化声明式描述,标记元数据并带来源编目,编译器可绑定其原语生成新任务harness,避免从头搜索,还提出了数据库界可开展的相关研究议程。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.28433 2026-08-31 cs.AI cs.LO cs.MA 新提交 70%

Prove2Me: An Open Collaborative Platform for Scaling Math Formalization

Prove2Me:用于规模化数学形式化的开源协作平台

Shuze Chen, Kunal Marwaha, Xiaoyang Lu, Henry Yuen, Tianyi Peng

机构 * Columbia University(哥伦比亚大学) University of Chicago(芝加哥大学) Purdue University(普渡大学)

专题命中 软件智能体 :agent(abstract);AI agent(abstract);分类 cs.AI

AI总结 Prove2Me是支持人类与AI智能体协作的开源数学形式化平台,可降低大规模数学形式化的门槛,实现众包式规模化形式化验证。

Comments this https URL (https://prove2.me)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.28400 2026-08-31 cs.CR cs.SE 新提交 57%

When Verified Source Becomes Attack Input: Defending Smart Contracts Against LLM-Based Vulnerability Scanning

当已验证源码成为攻击输入:防御智能合约免受基于大语言模型(LLM)的漏洞扫描

Mingyuan Huang, Zimo Ji, Yifan Mo, Shuai Wang

专题命中 软件智能体 :agent(abstract);分类 cs.SE

AI总结 本文提出DeLLMGuard框架,通过分离源码与运行时执行并验证相关信息,在保留公开源码披露和授权审计的同时,降低LLM智能体对智能合约漏洞扫描的准确性,防御恶意扫描。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.28230 2026-08-31 cs.SE 新提交 57%

Adaptive Strategy Generation for Boundary Value Exploration Beyond Numeric Inputs

超越数值输入的边界值探索自适应策略生成

Sabinakhon Akbarova, Felix Dobslaw, Robert Feldt

专题命中 软件智能体 :agentic(abstract);分类 cs.SE

AI总结 本文提出基于LLM的ABEX框架,以自适应策略生成替代手动设计变异算子,在含多类型输入的20个函数的黑盒测试中,其边界探索与故障揭示性能优于现有QD基线。

Comments 29 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.22967 2026-08-31 cs.LG 版本更新 57%

Learned Relay Representations for Forward-Thinking Discrete Diffusion Models

学习的中继表示用于前向思考的离散扩散模型

Benjamin Rozonoyer, Jacopo Minniti, Dhruvesh Patel, Neil Band, Avishek Joey Bose, Tim G. J. Rudner, Andrew McCallum

机构 * University of Massachusetts Amherst(马萨诸塞大学阿默斯特分校) University of Toronto(多伦多大学) Stanford University(斯坦福大学) Imperial College London(伦敦帝国学院) Mila Vijil

专题命中 软件智能体 :planning(abstract);分类 cs.LG

AI总结 提出Learned Relay Representations (Relay)方法,通过可微通道传递潜在信息,使掩码扩散模型在去噪步骤间前向思考,减少推理延迟并提升性能。

Comments 16 pages, 3 figures. Equal contribution: Benjamin Rozonoyer, Jacopo Minniti, and Dhruvesh Patel. Code: this https URL (https://github.com/jacopo-minniti/relay)

详情

展开后加载摘要…

URL PDF HTML 收藏

2. GUI与网页智能体 3 篇

2608.27477 2026-08-31 cs.AI cs.CV 新提交 77%

Benchmarking General Mobile Assistants in Challenging Real-World Scenarios

在具有挑战性的真实场景中对通用移动助手进行基准测试

Yiqi Zhu, Feiyu Gao, Jiaxing Fan, Jiahui Zeng, Minggang Wu, Chenliang Li, Haiyang Xu, Peng Li, Ming Yan, Yang Liu

机构 * Tsinghua University(清华大学) Alibaba Group(阿里巴巴集团) Institute for AI Industry Research (AIR), Tsinghua University(清华大学人工智能产业研究院(AIR))

专题命中 GUI与网页智能体 :agent(abstract);AI agent(abstract);planning(abstract);分类 cs.AI

AI总结 该研究提出名为GMA的移动助手基准,涵盖七个应用与300个不同难度任务,评估八个前沿模型发现其性能随任务复杂度提升而下降,还证实合适的智能体控制设计可显著提升性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.09467 2026-08-31 cs.CV cs.AI 版本更新 57%

RecoverFly: A Failure-Aware Reinforcement Learning Post-Training Framework for Aerial Vision-Language Navigation

RecoverFly:面向空中视觉语言导航的故障感知强化学习后训练框架

Boxiong Wang, Hui Kang, Geng Sun, Jiahui Li, Chao Yu, Daxin Tian

专题命中 GUI与网页智能体 :planning(abstract);分类 cs.AI

AI总结 RecoverFly是面向端到端无人机视觉-语言-动作策略的故障感知强化学习后训练框架,在TravelUAV基准上实现了优于AerialVLA的性能,提升了导航成功率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.27866 2026-08-31 cs.CV 新提交 50%

Iron: Intent-Aligned and Retrospective Dual Learning Framework for Enhancing Generalist Virtual Agents

Iron:用于增强通用虚拟智能体的意图对齐与回溯双学习框架

Jiahe Ying, Wendong Bu, Kaihang Pan, Bingchen Miao, Siyu Chen, Wen Wang, Xueming Jiang, Juncheng Li, Siliang Tang

机构 * Fudan University(复旦大学) Zhejiang University(浙江大学)

专题命中 GUI与网页智能体 :agentic(abstract)

AI总结 Iron是用于训练GUI智能体的意图对齐与回溯双学习框架,通过逐步循环一致奖励和事后回放机制提升性能,在跨环境等任务中优于三倍数据训练的模型,未见过的网页任务获25.06%相对提升。

Comments 11 pages, 5 figures, and 4 tables

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 记忆与上下文管理 13 篇

2608.27924 2026-08-31 cs.CL 新提交 89%

What Makes Agent Memory Useful for Reliable Unanswerable Question Handling?

是什么让智能体记忆对可靠的无答案问题处理有用?

Chuanyuan Tan, Junjie Yu, Yuxin Wang, Yining Zheng, Xipeng Qiu, Wenliang Chen

机构 * School of Computer Science and Technology, Soochow University(苏州大学计算机科学与技术学院) Suzhou City University(苏州城市学院) Shanghai Key Lab of Intelligent Information Processing(上海智能信息处理重点实验室) College of Computer Science and Artificial Intelligence, Fudan University(复旦大学计算机科学技术与人工智能学院) Shanghai Innovation Institute(上海创新研究院)

专题命中 记忆与上下文管理 :agentic(summary_cn,abstract);agent(title,abstract);分类 cs.CL

AI总结 该研究在agentic RAG框架下,评估不同记忆方法对UAQ处理的作用,发现记忆提升UAQ性能具选择性,程序与规则类记忆结合互补信号效果最优,可靠UAQ记忆依赖保留可迁移行为指导。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.26403 2026-08-31 cs.CL 版本更新 86%

ProfileFoundry: A Synthetic Person-Object Substrate for Privacy, Memory, and Tool-Use Evaluation in LLM Agent

ProfileFoundry: 用于LLM智能体隐私、记忆和工具使用评估的合成人物-对象基底

Sriram Selvam, Anneswa Ghosh

机构 * NVIDIA Corporation(英伟达公司)

专题命中 记忆与上下文管理 :agent(title,abstract);tool-use(title);分类 cs.CL

AI总结 提出ProfileFoundry,一个确定性生成器,发布10万个合成成人人物对象,包含快照、家庭、雇主等字段及事件、关系边,用于下游基础模型评估中的记忆、隐私等任务。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.26263 2026-08-31 cs.AI cs.MA 版本更新 83%

SKILL.state: Scalable Long-Horizon Agent Skills

SKILL.state:可扩展的长程智能体技能

Sanket Badhe, Priyanka Tiwari, Jonghyun Chung

机构 * Google LLC(谷歌公司) Purdue University(普渡大学)

专题命中 记忆与上下文管理 :agent(title,abstract);autonomous agent(abstract);分类 cs.AI

AI总结 针对现有智能体运行时的长程延迟与上下文污染问题,提出SKILL.state架构,用显式可变执行状态替代追加式对话历史,提升任务准确率并降低令牌消耗。

Comments accepted at EMNLP

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.27141 2026-08-31 cs.CR cs.AI 版本更新 81%

Safety Does Not Compose: Non-Decaying Loop State for Autonomous LLM Agents

安全性无法组合:自主大型语言模型智能体的非衰减循环状态

Chenhao Wu, Haoxuan Jia, Yang Liu, Yingguang Yang, Yuhan Lin, Chongyang Zhang, Hao Zheng, Yulin Huang, Jianshen Zhang, Yongzhi Qi, Shang Luo, Kefu Xu, Jifeng Zhu, Bin Chong

机构 * University of Chinese Academy of Sciences(中国科学院大学) Nanyang Technological University(南洋理工大学) Supply Chain Tech Team Y, JD.com(京东Y供应链技术团队) Peking University(北京大学) Fudan University(复旦大学) Fullive-AI(Fullive人工智能)

专题命中 记忆与上下文管理 :agent(summary_cn,abstract);分类 cs.AI

AI总结 该研究发现自主LLM智能体的轨迹级安全保障存在组合性缺陷,提出非衰减循环安全状态的LoopHarness方案,可限制未授权不可逆操作数量,通过Agent-SafetyBench等评估验证其有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.25553 2026-08-31 cs.IR cs.AI cs.CL 版本更新 81%

When Stale Constraints Go Unchecked: Budgeted Verification Failures in Inherited Agent Memory

当过时约束未被核查:智能体继承记忆中的带预算验证失败

Kazuki Nakayashiki

机构 * Glasp

专题命中 记忆与上下文管理 :agent(title,abstract);分类 cs.AI、cs.CL

AI总结 该研究针对智能体继承记忆中过时约束未被核查的问题,建模替代机制,发现重新分配预算槽位给关键路径可显著提升当前记录一致的决策,为记忆系统设计提供了参考。

Comments 41 pages, 3 figures, 18 tables. v3: adds four prospectively frozen, externally deposited experiments (interleaved replication with a repaired control; content-free freshness cue; ten-model cross-organisation panel; budget sweep and target-blind allocation rules); abstract, figures and limitations rewritten; the four original runs unchanged. Data and code at Zenodo: doi: https://doi.org/10.5281/zenodo.22147784

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.28363 2026-08-31 cs.AI 新提交 79%

EvoUndo: Recoverability-Constrained Self-Evolution for LLM Agent Harnesses

EvoUndo:面向大语言模型智能体执行框架的可恢复性约束自进化

Tanmay Sah, Dolly Sah, Harshul Jain, Tanya Sah

专题命中 记忆与上下文管理 :agent(title,abstract);分类 cs.AI

AI总结 本研究针对LLM智能体自进化的可恢复性问题,提出EvoUndo框架,通过协同设计验证、状态落地等,在600个任务中实现高比例的失败变更恢复,且效应存在模型依赖性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.28158 2026-08-31 cs.LG cs.DC 新提交 79%

HARTS: Efficient Agentic Reinforcement Learning for Hybrid-Attention Models over Arbitrary Rollout Trees

HARTS:基于任意展开树的混合注意力模型的高效智能体强化学习

Boyuan Meng (1), Peihua Bao (1), Hong Liu (1), Xiaowei Zhu (1), Chao Wang (1), Gen Li (1), Zhenxuan Pan (1) ((1) Ant Group, China)

机构 * Ant Group(蚂蚁集团)

专题命中 记忆与上下文管理 :agentic(title,abstract);分类 cs.LG

AI总结 HARTS是首个针对任意展开树前缀共享的混合注意力模型智能体RL系统,通过分块线性注意力算法等技术实现了4.81-4.87倍的训练加速,数值与奖励表现与基线相当。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.28476 2026-08-31 cs.CL 新提交 70%

ContextPilot: Teaching Agents for Proactive Context Management via Fine-grained RL

ContextPilot:通过细粒度强化学习为智能体教授主动上下文管理

Zhuoshi Pan, Qizhi Pei, Junru Lu, Honglin Lin, H. Vicky Zhao, Di Yin, Xing Sun

机构 * Tsinghua University(清华大学) Tencent(腾讯) Shanghai AI Lab(上海人工智能实验室)

专题命中 记忆与上下文管理 :planning(abstract);agentic(abstract);分类 cs.CL

AI总结 本研究针对现有主动上下文管理方法的局限,提出ContextPilot框架,通过扩充工具集并设计细粒度RL方法,在长程智能体任务中实现更紧凑上下文下的更优性能,优于现有基线。

Comments 10 pages, 6 figures, 5 tables, accepted to EMNLP 2026 (Main Track)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.28165 2026-08-31 cs.AI cs.HC cs.OS 新提交 70%

CrabOS: An Operating System for Human-AI Co-inhabitation

CrabOS:面向人类与AI共存的操作系统

Qi Yang, Yun Ma

机构 * Institute for Artificial Intelligence, Peking University(北京大学人工智能研究院)

专题命中 记忆与上下文管理 :agent(abstract);AI agent(abstract);分类 cs.AI

AI总结 该研究提出人类-AI共存概念,设计实现CrabOS操作系统,以共享文本对象为工作状态,实现人类与AI无缝交替主导任务,为AI智能体开发运行提供新基础。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.22149 2026-08-31 cs.RO cs.AI 版本更新 70%

Meta-Ctrl: Guaranteed Plan Generation by Decoupling Syntactic and Semantic Constraints

Meta-Ctrl:通过分离句法与语义约束实现带保证的规划生成

Gwen Yidou-Weng, Edward Sun, Tianyi Ma, Metin Alp Dogan, Benjie Wang, Allen Peng, Guy Van den Broeck, Yuchen Cui

机构 * Michigan State University(密歇根州立大学) University of California Los Angeles(加利福尼亚大学洛杉矶分校)

专题命中 记忆与上下文管理 :agent(abstract,abstract_cn);分类 cs.AI

AI总结 Meta-Ctrl是一种约束解码框架,通过引入元标记分离句法与语义约束,在保证规划满足约束的同时保留语言模型的规划质量,在WAH-NL数据集和真实桌面机器人上均取得优于GPT-4的效果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.27629 2026-08-31 cs.IR cs.AI physics.geo-ph 新提交 57%

LitCurate: A Configuration-Driven AI-Assisted Framework for Scientific Database Construction with an Application to Lower-Mantle Equation-of-State Data

LitCurate:一种配置驱动的AI辅助科学数据库构建框架及在下地幔状态方程数据中的应用

Abin Shakya, Wilson Samuels, Dominica Wilson, Gioia A. Marchi, Israa Draz, Chenxing Luo, Renata M. Wentzcovitch

专题命中 记忆与上下文管理 :workflow(abstract);分类 cs.AI

AI总结 本文提出开源框架LitCurate,整合大语言模型与可审计分阶段工作流构建科学数据库,并将其应用于构建含1334条条目的下地幔高压矿物相状态方程数据库,实现文献到可追溯数据的转化。

Comments 26 pages, 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.28391 2026-08-31 cs.LO cs.FL cs.GT 新提交 50%

Adaptive Strategies for GR(1) Games

GR(1)博弈的自适应策略

S. Krishna, Kaushik Mallik, Abhilasha Sharma Suman

专题命中 记忆与上下文管理 :agent(abstract)

AI总结 该研究针对GR(1)博弈提出自适应框架,将环境玩家视为非对抗智能体,通过监控活性属性调整策略,解决传统静态策略的保守性问题,其随机策略可渐近收敛至最优确定性策略,原型性能优于现有技术。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.28492 2026-08-31 cond-mat.mtrl-sci 新提交 50%

Wyckoff-Resolved Oxidation-State Atlas and Anion-Conditioned Priors for Materials Discovery

用于材料发现的Wyckoff分辨氧化态图集与阴离子条件先验

Boris Kiefer

专题命中 记忆与上下文管理 :workflow(abstract)

AI总结 本研究构建Wyckoff分辨氧化态图集及阴离子条件先验,提升材料氧化态分配覆盖度,为材料发现相关工作流提供可复现的先验支持。

Comments 19 pages (main & SI) and 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏

4. Agent评测 28 篇

2608.28345 2026-08-31 cs.AI 新提交 93%

AGENT-O: A Semantic Agent Card Framework for Interoperable and Governed Healthcare AI Agents

AGENT-O:用于可互操作且受管控的医疗AI智能体的语义智能体卡框架

Pengze Li, Cui Tao

专题命中 Agent评测 :agent(title,title_cn);AI agent(title,abstract);workflow(abstract);分类 cs.AI

AI总结 研究人员提出AGENT-O模块化本体框架,定义医疗AI智能体的语义智能体卡,评估279篇论文报告完整性,揭示评估规范差距,为结构化报告提供工具但不评估智能体质量与部署就绪性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.27856 2026-08-31 cs.LG cs.AI cs.MA 新提交 86%

FedEHR-Agents: Federated Agentic Optimization for Automated EHR Modeling

FedEHR-Agents:面向自动化电子健康记录(EHR)建模的联邦智能体优化框架

Jun Bai, Ruilin Wang, Yue Li

机构 * School of Computer Science, McGill University(麦吉尔大学计算机科学学院) Mila – Quebec AI Institute(米拉-魁北克人工智能研究所)

专题命中 Agent评测 :agentic(title,abstract);agent(abstract);autonomous agent(abstract);分类 cs.AI、cs.LG

AI总结 针对医院EHR数据隐私与协作局限,提出以经验为中心的FedEHR-Agents框架,通过联邦智能体聚合建模经验,在多医院EHR基准上的临床预测任务中表现优于基线方法。

Comments 25 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.28378 2026-08-31 cs.CL 新提交 85%

PersonaForge: Realistic Multi-Turn User Simulation for Agentic Systems

PersonaForge:面向智能体系统的逼真多轮用户模拟

Hanglong Lv, Dawei Zhu, Lei Li, Bowen Ye, Huaqiu Liu, Yifan Song, Bofei Gao, Weimin Xiong, Jinhao Dong, Chenhong He, Lingpeng Kong, Qi Liu, Tong Yang, Fuli Luo

机构 * Peking University(北京大学) Xiaomi(小米) The University of Hong Kong(香港大学) Renmin University of China(中国人民大学)

专题命中 Agent评测 :agentic(title,abstract);agent(abstract);workflow(abstract);分类 cs.CL

AI总结 该研究针对现有智能体系统训练评估中多轮用户交互数据不足的问题,提出PersonaForge模拟框架构建相关数据集与基准,实验证实其可提升智能体交互效率与任务表现。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.12015 2026-08-31 cs.CR cs.AI cs.CL cs.LG cs.MA 版本更新 85%

SkillSafetyBench: Evaluating Agent Safety under Skill-Facing Attack Surfaces

SkillSafetyBench:在技能面攻击表面下评估智能体安全性

Chang Jin, An Wang, Zeming Wei, Kai Wang, Biaojie Zeng, Qiaosheng Zhang, Chao Yang, Jingjing Qu, Xia Hu, Xingcheng Xu

机构 * Shanghai AI Laboratory(上海人工智能实验室) Peking University(北京大学) East China Normal University(华东师范大学)

专题命中 Agent评测 :agent(title,abstract);workflow(abstract);分类 cs.AI、cs.CL、cs.LG

AI总结 提出SkillSafetyBench基准,通过155个对抗案例评估大语言模型智能体在技能、本地工件和执行环境文件等非用户攻击下的安全失败模式。

Comments EMNLP 2026 Main

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.27886 2026-08-31 cs.AI 新提交 83%

Resource Constraints and Performance in Agentic AI Systems

智能体AI系统中的资源约束与性能

Amaz Salman, Malka Halgamuge, Teo Susnjak

机构 * School of Mathematical and Computational Sciences, Massey University(梅西大学数学与计算科学学院) RMIT University(皇家墨尔本理工大学)

专题命中 Agent评测 :agentic(title,abstract);agent(abstract);分类 cs.AI

AI总结 该研究对比OpenClaw与NanoBot两款智能体系统,发现两者完整任务完成率无统计差异,NanoBot部分完成率更高但资源消耗更优,建议智能体AI评估需结合能力、资源及执行记录。

详情

展开后加载摘要…

URL PDF HTML 收藏