Red Teaming Multimodal Language Models: Evaluating Harm Across Prompt Modalities and Models
针对多模态语言模型的红队测试:评估不同提示模态和模型的有害性
专题命中 红队测试 :red teaming(title);safety(abstract);harmlessness(abstract);分类 cs.CL
AI总结 本研究通过红队测试评估多模态语言模型在不同提示模态下的安全性,发现Pixtral 12B的有害响应率最高,而Claude Sonnet 3.5最安全,凸显了建立多模态安全基准的必要性。
Journal ref AAAI 2026 AIGOV Workshop and EurIPS 2025 Workshop on Unifying Perspectives on Learning Biases