ReasAlign: Reasoning Enhanced Safety Alignment against Prompt Injection Attack
ReasAlign: 基于推理增强的安全对齐以抵御提示注入攻击
机构 * Washington University in St. Louis(华盛顿大学圣路易斯分校) ; University of Wisconsin–Madison(威斯康星大学麦迪逊分校) ; NVIDIA(NVIDIA公司) ; Johns Hopkins University(约翰霍普金斯大学)
专题命中 提示注入 :alignment(title,abstract);safety(title,abstract);prompt injection(title,abstract);分类 cs.CL、cs.AI
AI总结 ReasAlign通过结构化推理和测试时缩放机制,有效防御提示注入攻击,实现安全与效用的最佳平衡。
Comments 15 pages, 10 figures