When Alignment Fails: Multimodal Adversarial Attacks on Vision-Language-Action Models
当对齐失败时:针对视觉-语言-动作模型的多模态对抗攻击
机构 * TGAI Lab, School of Engineering, Westlake University(西拉库大学工程学院TGAI实验室) ; Pennsylvania State University(宾夕法尼亚州立大学) ; Sony Research, Sony(索尼研究实验室,索尼) ; Xidian University(西安电子科技大学)
专题命中 多模态Agent :multimodal(title,abstract);cross-modal(abstract);分类 cs.CV、cs.AI
AI总结 本文提出VLA-Fool,针对视觉-语言-动作模型的多模态对抗攻击,揭示其在白盒和黑盒环境下具身多模态对齐的脆弱性。