NeuronGuard: Robust LLM Safety Alignment via Ablation-Aware Safety Signal Redistribution
NeuronGuard:通过感知消融的安全信号重新分配实现鲁棒的大语言模型安全对齐
专题命中 越狱攻击 :alignment(title,abstract);safety(title,abstract);jailbreak(abstract);分类 cs.AI、cs.LG
AI总结 NeuronGuard是一种微调阶段防御方法,通过重新分配安全信号抵御越狱和神经元级攻击,在三个LLM、六种攻击下实现近乎零攻击成功率且保持任务准确率。
Comments To appear in EMNLP 2026 (Findings)