Learning diverse attacks on large language models for robust red-teaming and safety tuning
针对大语言模型学习多样化攻击以用于鲁棒红队测试与安全调优
Seanie Lee, Minsu Kim, Lynn Cherif, David Dobre, Juho Lee, Sung Ju Hwang, Kenji Kawaguchi, Gauthier Gidel, Yoshua Bengio, Esmeralda S. Whitammer, Moksh Jain
机构
*
KAIST(韩国科学技术院)
;
Mila – Québec AI Institute(米拉-魁北克人工智能研究所)
;
Université de Montréal(蒙特利尔大学)
;
McGill University(麦吉尔大学)
;
National University of Singapore(新加坡国立大学)
;
University of Edinburgh(爱丁堡大学)
;
CIFAR(加拿大高级研究所)