arXivDaily arXiv每日学术速递 周一至周五更新

PAPERDAILY REPORTS

上海AI实验室等提出StepGuard,智能体攻击成功率降77.3%、效用少2.8点

作者:arXivDaily编辑部 arXiv 2608.24777 cs · cs.AI · cs.CR

工具型智能体一旦执行发邮件、改文件或支付等操作,事后识别风险往往已经太晚。上海人工智能实验室、北京航空航天大学、复旦大学、中国人民大学等机构提出StepGuard,在每次工具调用前检查动作,也能对完成后的整条轨迹做审计。

在AgentDojo与AgentDyn上,StepGuard相对无防护设置把平均攻击成功率降低77.3%,平均任务效用下降2.8个百分点。77.3%是相对降幅,只汇总这两个环境;AgentHarm的安全—效用权衡更弱。

护栏从“看完再判”移到执行之前

轨迹级护栏要等智能体完成多步操作再评分。如果恶意指令藏在文件或网页内容中,智能体可能先泄露信息、覆盖文件,之后护栏才发现异常。StepGuard读取用户目标、当前上下文与候选工具调用,在动作送入环境前给出安全判断。

项目动机图:提示注入改变工具轨迹后,事后护栏即使识别风险,也无法撤回已经执行的外部动作。

同一个模型还接受完整轨迹输入,用于离线审计。这样训练和部署只维护一套4B参数模型,不必为逐步检查和事后复盘分别准备护栏。

StepGen生成同上下文的安全与风险动作

训练难点是,安全样本与风险样本常来自不同场景,模型容易学到表面关键词。StepGen先构造风险轨迹,再固定风险步骤之前的上下文,只替换该步骤的动作,形成前缀一致的安全—风险对。监督信号因此落到“同一情境下做了哪一步”。

项目方法图:StepGen生成前缀对齐的安全与风险轨迹,先监督微调,再用Balance-GRPO校准。

数据引擎覆盖桌面和企业服务,共涉及约5078种工具;其中支付、代码仓库、补丁和命令行等15类高敏感工具用于锚定对比。论文中的可执行风险工作流只向授权研究者开放,公开内容用于防护评估。

Balance-GRPO按两类准确率动态调权

普通强化学习会把安全与风险样本同权处理。若模型已经很会拦风险、却频繁误伤正常动作,继续平均优化可能让防御偏差扩大。Balance-GRPO根据当前批次对两类动作的准确率差,给较弱一侧更高学习权重。

静态评测覆盖五个基准。StepGuard在所测开放权重护栏中取得最高平均准确率,平均轨迹级准确率与GPT-5.4相当;项目页给出的数值为83.0。这里的“相当”限定于论文选用的基准和指标,不代表通用能力等价。

项目结果图:StepGuard与通用模型、语言模型护栏和智能体护栏在步骤级与轨迹级任务上的比较。

运行时防护必须同时看风险和任务完成

AgentDojo与AgentDyn分别测试提示注入和动态多步工具任务。StepGuard把两者平均攻击成功率相对降低77.3%,效用仅少2.8点。消融中,Balance-GRPO把安全—风险准确率差从13.0缩到8.0,并改善正常任务效用。

论文工作流图:护栏在候选工具动作执行前读取上下文并决定允许或拦截。

AgentHarm仍更难,说明低攻击成功率不应脱离任务类型解读。模型还依赖合成轨迹与模型标注,面对真实组织权限、模糊授权和跨系统连锁操作时,误判模式可能不同。

下一步是接入真实权限与回滚机制

逐步护栏适合放在智能体与工具网关之间,为高风险动作增加统一检查点。生产系统还要结合真实身份、最小权限、人工确认和可回滚事务;单个分类模型不能替代权限控制。

项目页已提供代码与模型入口。后续应测量每次调用增加的延迟,扩展真实企业工具和中文任务,并针对权限随时间变化的场景评估。若护栏无法读到完整授权状态,再高的基准准确率也可能在部署时拦错或漏放。

上线评估还应按工具风险分层:读取公开网页、修改内部文件和发起不可逆外部操作不能共用同一阈值。对高风险调用,StepGuard的判断可以触发人工确认;对低风险调用,则要重点控制误拦率和额外延迟,并保留可审计的判定依据。

参考资料

https://arxiv.org/abs/2608.24777

https://arxiv.org/html/2608.24777

https://zheng977.github.io/StepGuard/

https://github.com/zheng977/StepGuard

https://huggingface.co/ninty-seven/StepGuard