Benign Inputs, Harmful Outputs: Cross-Modal Jailbreaking via Distributed Semantic Recomposition
良性输入,有害输出:通过分布式语义重组的跨模态越狱
专题命中 多模态训练与对齐 :cross-modal(title,abstract);multimodal(abstract)
AI总结 提出分布式语义重组(DSR)框架,将有害意图分解为良性文本和视觉基元,利用多模态大模型的推理能力在跨模态推理阶段融合为有害输出,实现高攻击成功率且输入毒性极低。
Comments 11 pages, 5 figures