SafeLLM: Unlearning Harmful Outputs from Large Language Models against Jailbreak Attacks
机构 * Department of Electrical and Computer Engineering, Queen’s University(电气与计算机工程系,皇后大学) ; School of Computing, Queen’s University(计算机学院,皇后大学)
专题命中 越狱攻击 :jailbreak(title,abstract);alignment(abstract);safety(abstract);分类 cs.LG