SafeNeuron: Neuron-Level Safety Alignment for Large Language Models
SafeNeuron: 大语言模型的神经层面安全对齐
机构 * Xidian University, Xi'an, China(西安电子科技大学) ; Harbin Institute of Technology, Harbin, China(哈尔滨工业大学) ; National University of Singapore,Singapore(新加坡国立大学)
AI总结 SafeNeuron通过神经层面安全对齐框架提升模型鲁棒性,减少攻击风险并保持通用能力。