Unveiling the Fragility of Vision-Language Models: Multi-Modal Adversarial Synergy via Texture-Constrained Perturbations and Cross-Modal Optimization
揭示视觉-语言模型的脆弱性:通过纹理约束扰动和跨模态优化的多模态对抗协同
机构 * School of Software Engineering, Huazhong University of Science and Technology(华中科技大学软件学院) ; Nanyang Technological University, Singapore(新加坡南洋理工大学) ; University College London(伦敦大学学院)
AI总结 提出多模态对抗协同框架,通过纹理约束的通用对抗扰动和可学习的文本提示扰动,在黑盒设置下联合优化,揭示视觉-语言模型在多模态攻击下的脆弱性。
Comments Publish in AAAI 2026