PrisonBreak: Jailbreaking Large Language Models with at Most Twenty-Five Targeted Bit-flips
机构 * Oregon State University(俄勒冈州立大学) ; University of British Columbia(不列颠哥伦比亚大学) ; University of Toronto(多伦多大学) ; George Mason University(乔治·梅森大学) ; Rutgers University(罗格斯大学) ; University of Texas at Arlington(德克萨斯大学阿灵顿分校)
专题命中 越狱攻击 :alignment(abstract);safety(abstract);jailbreak(abstract);分类 cs.CL、cs.LG
Comments Pre-print