Text-Anchored Semantic Perturbations for Transferable Jailbreak Attacks on Multimodal Large Language Models
面向多模态大语言模型的可迁移越狱攻击的文本锚定语义扰动
机构 * Harbin Institute of Technology(哈尔滨工业大学) ; Pengcheng Laboratory(鹏城实验室) ; Pazhou Laboratory (Huangpu)(琶洲实验室(黄埔))
专题命中 越狱攻击 :jailbreak(title,abstract);alignment(abstract);safety(abstract);分类 cs.CL
AI总结 本研究针对多模态大语言模型易受越狱攻击的问题,提出TA-SPA黑盒越狱框架,通过文本锚定语义分解与语义保留增强实现可迁移攻击,在商业模型及防御下表现出竞争力,推动表征级安全对齐研究。
Comments Accept by EMNLP 2026 Findings