ReasAlign: Reasoning Enhanced Safety Alignment against Prompt Injection Attack
ReasAlign: 基于推理增强的安全对齐以抵御提示注入攻击
机构 * Washington University in St. Louis(华盛顿大学圣路易斯分校) ; University of Wisconsin–Madison(威斯康星大学麦迪逊分校) ; NVIDIA(NVIDIA公司) ; Johns Hopkins University(约翰霍普金斯大学)
AI总结 ReasAlign通过结构化推理和测试时缩放机制,有效防御提示注入攻击,实现安全与效用的最佳平衡。
Comments 15 pages, 10 figures