JailBound: Jailbreaking Internal Safety Boundaries of Vision-Language Models
JailBound: 视觉语言模型内部安全边界的劫持
机构 * Shanghai Jiao Tong University(上海交通大学) ; Shanghai Artificial Intelligence Laboratory(上海人工智能实验室) ; Fudan University(复旦大学) ; Xuan Tong(宣通) ; NSFOCUS
专题命中 图文多模态 :cross-modal(abstract);分类 cs.CV
AI总结 JailBound通过在视觉语言模型的潜在空间中探索安全边界,提出了一种新的劫持框架,有效提升了白盒和黑盒攻击成功率,揭示了模型的安全风险。
Comments The Thirty-ninth Annual Conference on Neural Information Processing Systems (NeurIPS 2025)