Adaptive Defense against Harmful Fine-Tuning for Large Language Models via Bayesian Data Scheduler
机构 * Nanyang Technological University(南洋理工大学) ; Shenzhen Campus of Sun Yat-sen University(中山大学深圳校区) ; University of Central Florida(佛罗里达大学) ; Tsinghua University(清华大学)
专题命中 越狱攻击 :alignment(abstract);safety(abstract);分类 cs.AI、cs.LG