Steering Multimodal Large Language Models Decoding for Context-Aware Safety
面向上下文感知安全的多模态大语言模型解码引导
机构 * University of Notre Dame(notre dame 大学) ; University of Washington(华盛顿大学) ; Johns Hopkins University(约翰霍普金斯大学) ; Georgia Institute of Technology(佐治亚理工学院)
专题命中 多模态训练与对齐 :multimodal(title,abstract);MLLM(abstract,abstract_cn);分类 cs.CL、cs.AI
AI总结 针对多模态大语言模型安全对齐的平衡难题,提出SafeCoDe解码框架,通过两阶段机制优化上下文敏感的弃权行为,在多基准实验中有效提升安全性能且保留模型有用性。
Comments EMNLP 2026 Main