Deep Ignorance: Filtering Pretraining Data Builds Tamper-Resistant Safeguards into Open-Weight LLMs
深度无知:过滤预训练数据在开放权重大语言模型中构建抗篡改的安全保障
机构 * EleutherAI ; UK AI Security Institute(英国人工智能安全研究所) ; University of Oxford(牛津大学) ; OATML, University of Oxford(OATML,牛津大学)
专题命中 预训练与数据 :pretraining(title,abstract);post-training(abstract);分类 cs.AI、cs.LG
AI总结 本文提出通过过滤预训练数据中的双用途内容,增强开放权重大语言模型的抗篡改能力,实验显示其在对抗微调攻击上表现优异,且未影响其他能力。
Comments https://deepignorance.ai/