Provably Protecting Fine-Tuned LLMs from Training Data Extraction while Preserving Utility
可证明地保护微调的LLM免受训练数据提取攻击同时保持效用
机构 * Department of Software and Information Systems Engineering, Ben-Gurion University of the Negev, Beer Sheva, Israel(软件与信息系统工程系,内盖夫本·古里安大学,贝尔谢巴,以色列)
专题命中 预训练与数据 :LLM(title_cn);large language model(abstract);language model(abstract);分类 cs.LG
AI总结 本文提出了一种基于近访问自由(NAF)的算法SCP-Δ_r,通过相对概率和基础模型对低影响token进行平滑处理,从而在理论上有更优的界限,并在实践中有效抵御训练数据提取攻击,同时保持性能损失最小。
Comments 21 pages, 5 figures