Retrieval Heads Meet Vision: Uncovering How VLMs Locate and Extract Visual Information
检索头与视觉结合:揭示视觉语言模型如何定位和提取视觉信息
机构 * KAIST(韩国科学技术院)
AI总结 该研究发现视觉语言模型(VLMs)中存在视觉检索头(VRHs),其占注意力头的1.7%-2.6%,负责将文本描述与图像区域建立因果关联,屏蔽前20个VRHs可使定位准确率降低多达80个百分点,且VRHs具备泛化性、功能特异性与架构共享性。