Hierarchical Refinement of Universal Multimodal Attacks on Vision-Language Models
面向视觉语言模型的层次化通用多模态攻击
机构 * School of Electrical Engineering and Computer Science, the University of Queensland(电气工程与计算机科学学院,昆士兰大学) ; Department of Computer Science, City University of Hong Kong(计算机科学系,香港城市大学)
专题命中 图文多模态 :multimodal(title,abstract);分类 cs.CV、cs.MM
AI总结 本文提出HRA框架,通过层次化优化路径和文本重要性建模,实现对视觉语言模型的通用多模态攻击,验证了其在多种任务和数据集上的优越迁移性能。
Comments 10 pages, 7 figures