SafeBehavior: Simulating Human-Like Multistage Reasoning to Mitigate Jailbreak Attacks in Large Language Models
机构 * Wenzhou-Kean University(温州市凯恩大学) ; University of Bremen(不莱梅大学) ; Case Western Reserve University(凯斯西储大学) ; Duke Kunshan University(杜克昆山大学)
专题命中 越狱攻击 :jailbreak(title,abstract);safety(abstract);分类 cs.AI
Comments 27 pages, 5 figure