Intrinsic Structure: Spectral Identifiability for Mechanistic Interpretability
内在结构:机制可解释性的谱可识别性
机构 * IISER Bhopal(印度博帕尔科学教育与研究所) ; IBM Research(IBM研究院)
AI总结 本研究提出机制可解释性的谱可识别性定理,利用Koopman算子构建模型内在指纹,在GPT-2 small等模型上验证了谱的收敛性及相关性质,为机制可解释性的基础组件提供了首个可识别性理论。