Can LLM Safety Be Ensured by Constraining Parameter Regions?
通过约束参数区域能否确保大语言模型的安全性?
机构 * Nanyang Technological University(南洋理工大学) ; Institute for Infocomm Research (I 2 R)(信息通信研究所) ; IRIT, Université de Toulouse, CNRS, Toulouse INP(图卢兹大学IRIT研究所、法国国家科学研究中心) ; IPAL, CNRS-NUS-A*STAR(IPAL、法国国家科学研究中心-南洋理工大学-A*STAR)
专题命中 安全评测 :safety(title,abstract);分类 cs.AI、cs.LG
AI总结 本文评估了四种安全区域识别方法,发现其在不同粒度和数据集下重叠程度低,表明现有方法难以可靠地识别稳定的安全区域。
Comments 32 pages