SafeNeuron: Neuron-Level Safety Alignment for Large Language Models
SafeNeuron: 大语言模型的神经层面安全对齐
机构 * Xidian University, Xi'an, China(西安电子科技大学) ; Harbin Institute of Technology, Harbin, China(哈尔滨工业大学) ; National University of Singapore,Singapore(新加坡国立大学)
专题命中 后训练与偏好优化 :large language model(title,abstract);language model(title,abstract);preference optimization(abstract);分类 cs.LG
AI总结 SafeNeuron通过神经层面安全对齐框架提升模型鲁棒性,减少攻击风险并保持通用能力。