SPARD: Defending Harmful Fine-Tuning Attack via Safety Projection with Relevance-Diversity Data Selection
SPARD: 通过安全投影与相关性-多样性数据选择防御有害微调攻击
机构 * Department of Computer Science and Engineering, The Hong Kong University of Science and Technology(香港科学与技术大学计算机科学与工程系) ; Department of Computer Science and Engineering, Southern University of Science and Technology(南方科技大学计算机科学与工程系) ; Department of Computer Science and Engineering, The Chinese University of Hong Kong(香港中文大学计算机科学与工程系) ; Platform and Content Group, Tencent(腾讯平台与内容组) ; Chinese Medicine Guangdong Laboratory(广东中医实验室)
AI总结 提出SPARD框架,结合安全投影交替优化和相关性-多样性数据选择,防御有害微调攻击,在保持任务精度的同时显著降低攻击成功率。
Comments Accepted by ICML 2026