Transferability of Adversarial Attacks in Video-based MLLMs: A Cross-modal Image-to-Video Approach
视频基于多模态大语言模型中的对抗攻击可迁移性:一种跨模态图像到视频的方法
专题命中 视频多模态 :cross-modal(title);multimodal(abstract);MLLM(abstract);分类 cs.CV
AI总结 本文提出了一种跨模态图像到视频的对抗攻击方法,用于研究视频多模态大语言模型的可迁移性,实验表明该方法在多个视频-文本多模态任务中表现出强对抗转移性。