Causal Front-Door Adjustment for Robust Jailbreak Attacks on LLMs
因果前门调整用于对抗大语言模型的鲁棒性劫持攻击
机构 * Institute of Software Chinese Academy of Sciences, Beijing, China(中国科学院软件研究所) ; University of Chinese Academy of Sciences, Beijing, China(中国科学院大学) ; Institute of Information Engineering Chinese Academy of Sciences, Beijing, China(中国科学院信息工程研究所) ; Hong Kong University of Science and Technology, China, Hong Kong, China(香港科学与技术大学)
专题命中 越狱攻击 :jailbreak(title,abstract);alignment(abstract);safety(abstract);分类 cs.CL
AI总结 本文提出CFA²攻击方法,通过因果前门准则和稀疏自编码器实现对大语言模型的鲁棒性劫持,提升攻击成功率并提供机制解释。