When Style Breaks Safety: Defending LLMs Against Superficial Style Alignment
当风格破坏安全性:防御大语言模型对抗浅层风格对齐
机构 * Massachusetts Institute of Technology(麻省理工学院)
专题命中 越狱攻击 :alignment(title,abstract);safety(title,abstract);jailbreak(abstract);分类 cs.CL、cs.AI、cs.CY
AI总结 本研究探讨了风格对齐对大语言模型安全性的影响,提出 SafeStyle 防御策略有效缓解了浅层风格对齐带来的风险。
Comments Accepted by ICLR 2026