RepIt: Steering Language Models with Concept-Specific Refusal Vectors
RepIt:通过概念特定拒绝向量引导语言模型
机构 * University of California, Santa Cruz(加州大学圣克鲁兹分校) ; University of California, Berkeley(加州大学伯克利分校)
专题命中 安全训练 :safety(abstract);分类 cs.CL、cs.AI
AI总结 RepIt通过隔离语言模型激活中的概念特定表示,揭示当前安全评估的漏洞,展示如何利用少量资源实现针对特定概念的拒绝抑制。
Comments ICLR 2026