CLEAR: Continuous Latent Adapter Routing for Utility-Preserving LLM Safety Alignment
CLEAR:用于保持效用的大语言模型安全对齐的连续潜在适配器路由
机构 * Stanford University(斯坦福大学) ; University of Illinois at Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) ; Siebel School of Computing and Data Science, University of Illinois at Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校西贝尔计算与数据科学学院) ; Computer Science, Stanford University(斯坦福大学计算机科学系)
AI总结 本研究提出CLEAR框架,通过轻量型隐藏状态门控控制安全低秩适配器的激活强度,在降低LLM有害输出的同时,减少了全局安全调优带来的效用损失,实现了安全与效用的更好平衡。