AdvPrefix: An Objective for Nuanced LLM Jailbreaks
AdvPrefix: 一种面向 nuanced LLM 模型 jailbreak 的目标
机构 * University of Maryland, College Park(马里兰大学 College Park分校) ; FAIR, Meta(Meta的FAIR)
专题命中 越狱攻击 :alignment(abstract);safety(abstract);jailbreak(abstract);分类 cs.CL、cs.AI、cs.LG
AI总结 AdvPrefix 提出了一种新的目标,通过结合高预填充攻击成功率和低负对数似然来选择模型依赖的前缀,以提升 jailbreak 攻击的精确性和有效性。