SkillSafetyBench: Evaluating Agent Safety under Skill-Facing Attack Surfaces
SkillSafetyBench:在技能面攻击表面下评估智能体安全性
机构 * Shanghai AI Laboratory(上海人工智能实验室) ; Peking University(北京大学) ; East China Normal University(华东师范大学)
专题命中 越狱攻击 :safety(title,abstract);alignment(abstract);分类 cs.CL、cs.AI、cs.LG
AI总结 提出SkillSafetyBench基准,通过155个对抗案例评估大语言模型智能体在技能、本地工件和执行环境文件等非用户攻击下的安全失败模式。
Comments EMNLP 2026 Main