GuardAlign: Test-time Safety Alignment in Multimodal Large Language Models
GuardAlign: 多模态大语言模型中的测试时安全性对齐
机构 * MoE Key Lab of BIPC, University of Science and Technology of China(摩埃关键实验室,中国科学技术大学) ; Nanyang Technological University(南洋理工大学) ; National University of Singapore(新加坡国立大学) ; Tianjin University(天津大学)
专题命中 幻觉与事实性 :safety(title,abstract);alignment(title)
AI总结 GuardAlign通过OT增强的安全检测和跨模态注意力校准,有效提升多模态大语言模型在测试时的安全性,减少不安全响应率并提升任务表现。
Comments ICLR 2026