Towards Understanding Subliminal Learning: When and How Hidden Biases Transfer
迈向理解潜意识学习:何时以及如何隐藏偏见转移
机构 * University of Freiburg(弗赖堡大学) ; University of Oxford(牛津大学) ; WhiteBox
专题命中 预训练与数据 :language model(abstract);分类 cs.AI、cs.LG
AI总结 研究探讨了语言模型在蒸馏过程中潜意识学习的机制,发现早期层的微调足以引发隐藏偏见的转移,并指出该现象对提示改写敏感。
Comments ICLR 2026