Response-Based Knowledge Distillation for Multilingual Jailbreak Prevention Unwittingly Compromises Safety
基于响应的知识蒸馏用于多语言对抗预防无意中削弱了安全性
机构 * OpenAI ; Meta
AI总结 本文研究了基于响应的知识蒸馏在多语言对抗预防中的应用,发现标准微调会增加学生模型的对抗成功率,但去除边界拒绝可缓解安全性下降。
Comments 9 pages, Poster presented at Socially Responsible and Trustworthy Foundation Models at NeurIPS 2025 Workshop