Logic Jailbreak: Efficiently Unlocking LLM Safety Restrictions Through Formal Logical Expression
逻辑突破:通过形式逻辑表达高效解锁LLM安全限制
机构 * City University of Hong Kong(香港城市大学) ; Rutgers University(罗格斯大学) ; University of Science and Technology of China(中国科学技术大学) ; Universiteit van Amsterdam(阿姆斯特丹大学) ; Baidu Inc(百度公司)
AI总结 本文提出LogiBreak方法,通过将有害提示转化为形式逻辑表达,利用对齐数据与逻辑输入之间的分布差异,有效绕过LLM安全机制,验证其在多语言数据集中的有效性。