DLM-Scope: Mechanistic Interpretability of Diffusion Language Models via Sparse Autoencoders
DLM-Scope:通过稀疏自编码器实现扩散语言模型的机制可解释性
机构 * The University of Hong Kong(香港大学) ; Tongyi Lab, Alibaba Group Inc(阿里云实验室)
专题命中 知识编辑与模型理解 :language model(title,abstract);LLM(abstract);large language model(abstract);post-training(abstract)
AI总结 DLM-Scope通过稀疏自编码器首次实现扩散语言模型的机制可解释性,展示了其在特征提取和干预中的有效性。
Comments 23 pages