When Skills Meet Safety: Benchmarking and Characterizing the Adaptive Jailbreak Robustness of Skill-Merged LLMs
当技能与安全相遇:对技能合并大语言模型的自适应越狱鲁棒性进行基准测试与表征
Yu Ma, Hongli Shi, Jing Li, Xinran Xu, Weiwei Hou
机构
*
Google(谷歌公司)
;
University of New South Wales(新南威尔士大学)
;
University of Technology Sydney(悉尼科技大学)
;
Zhejiang University(浙江大学)
;
Australian National University(澳大利亚国立大学)
机构
*
University of California San Diego(加州大学圣地亚哥分校)
;
University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校)
;
Google(谷歌)
;
University of California Santa Barbara(加州大学圣芭芭拉分校)