SafeSteer: A Decoding-level Defense Mechanism for Multimodal Large Language Models
SafeSteer: 多模态大语言模型中的解码级防御机制
机构 * Tsinghua University(清华大学) ; Shanghai Jiao Tong University(上海交通大学) ; Kuaishou Technology(快手科技) ; School of Computer Science and Technology, Beihang University(北航计算机科学与技术学院) ; Nanjing University of Aeronautics and Astronautics(南京航空航天大学) ; Chongqing University(重庆大学) ; Wuhan University(武汉大学)
AI总结 本文提出SafeSteer,通过解码阶段的轻量探针和模态语义对齐向量,提升多模态大语言模型的安全性,实验表明其能提升33.40%的安全性而不需微调。