Probabilistic Modeling of Jailbreak on Multimodal LLMs: From Quantification to Application
专题命中 越狱攻击 :jailbreak(title,abstract);alignment(abstract);safety(abstract)
AI 大模型
大模型对齐、安全、越狱、红队、提示注入和可信评测。
专题命中 越狱攻击 :jailbreak(title,abstract);alignment(abstract);safety(abstract)
专题命中 越狱攻击 :alignment(abstract);safety(abstract);jailbreak(abstract);分类 cs.CL、cs.AI、cs.CY
机构 * CISPA Helmholtz Center for Information Security(CISPA海德堡信息安全中心) ; Xi’an Jiaotong University(西安交通大学)
专题命中 越狱攻击 :jailbreak(title,abstract);分类 cs.AI
Comments 17 pages, 5 figures. For the code and data supporting this work, see https://trustairlab.github.io/jades.github.io/