Large Language Models Generate Harmful Responses Using a Distinct Mechanism, Shared Across Harm Types
大语言模型通过一种独特的统一机制生成有害内容
机构 * Kempner Institute, Harvard University(哈佛大学肯普纳研究所) ; Princeton University(普林斯顿大学) ; Harvard University(哈佛大学) ; Cohere ; Technion—IIT(以色列理工学院)
AI总结 研究通过权重剪枝揭示大语言模型中有害生成的内部结构,发现有害内容生成依赖于一组通用且与良性能力不同的权重,表明对齐训练重塑了有害表示,解释了领域微调引发的广泛对齐偏差。