Learning to Detect Language Model Training Data via Active Reconstruction
通过主动重建学习检测语言模型训练数据
机构 * University of Washington(华盛顿大学) ; Cornell University(康奈尔大学) ; Allen Institute for Artificial Intelligence(人工智能研究院)
AI总结 本文提出主动数据重建攻击方法,通过强化学习主动诱导模型重建文本以检测语言模型训练数据,实验表明其在检测预训练、后训练和蒸馏数据方面表现优于现有方法。