PrisonBreak: Jailbreaking Large Language Models with at Most Twenty-Five Targeted Bit-flips
机构 * Oregon State University(俄勒冈州立大学) ; University of British Columbia(不列颠哥伦比亚大学) ; University of Toronto(多伦多大学) ; George Mason University(乔治·梅森大学) ; Rutgers University(罗格斯大学) ; University of Texas at Arlington(德克萨斯大学阿灵顿分校)
专题命中 后训练与偏好优化 :large language model(title,abstract);language model(title,abstract);LLM(abstract);post-training(abstract)
Comments Pre-print