LatentLens: Revealing Highly Interpretable Visual Tokens in LLMs
LatentLens: 揭示大语言模型中高度可解释的视觉标记
机构 * University of Cambridge(剑桥大学)
专题命中 其他安全 :alignment(abstract);分类 cs.AI
AI总结 提出 LatentLens 方法,通过将视觉标记与文本语料库中的上下文标记表示进行最近邻匹配,实现视觉标记的可解释性,发现大多数视觉标记在各层均具有可解释性。
Comments ICML 2026 (Camera Ready)