Learning to Detect Unseen Jailbreak Attacks in Large Vision-Language Models
学习检测未见过的大型视觉-语言模型中的对抗攻击
专题命中 越狱攻击 :jailbreak(title,abstract);alignment(abstract);safety(abstract);分类 cs.AI
AI总结 LoD通过学习模型内部激活生成安全表示,实现对未见过的对抗攻击的高效检测,提升检测性能和效率。
Comments 17 pages; Previously this version appeared as arXiv:2510.15430 (https://arxiv.org/abs/2510.15430) which was submitted as a new work by accident