Equivariant Sparse Autoencoders: Mechanistic Interpretability of Neural Networks on Symmetric Data
等变稀疏自编码器:对称数据上神经网络的机制可解释性
机构 * University of Amsterdam(阿姆斯特丹大学)
AI总结 该研究针对稀疏自编码器在对称数据上的不可识别问题,提出等变稀疏自编码器,可避免缺陷并发现更有用的下游任务特征,表明重构质量与特征实用性在对称下可能负相关。
Comments NeurIPS 2025 Mechanistic Interpretability and UniReps workshops