Aligned but Fragile: Enhancing LLM Safety Robustness via Zeroth-Order Optimization
对齐但脆弱:通过零阶优化增强LLM安全鲁棒性
机构 * The State Key Laboratory of Blockchain and Data Security(区块链与数据安全国家重点实验室) ; Hangzhou High-Tech Zone (Binjiang) Institute of Blockchain and Data Security(杭州高科技园区(滨江)区块链与数据安全研究院) ; Sun Yat-sen University(中山大学) ; KAUST(卡塔尔大学)
专题命中 安全评测 :safety(title,abstract);alignment(abstract);分类 cs.AI
AI总结 针对大语言模型安全对齐后易受轻量级后处理(如参数噪声、激活噪声或量化)影响的问题,提出基于零阶优化的混合框架,通过先标准一阶安全对齐再零阶精炼提升鲁棒性,并利用扰动评估估计层鲁棒性敏感性以高效聚焦关键层更新。