Attention Alignment Between Humans and Vision-Language Models
人类与视觉语言模型之间的注意力对齐
机构 * Princeton Neuroscience Institute, Princeton University(普林斯顿大学普林斯顿神经科学研究所) ; Department of Psychology, Princeton University(普林斯顿大学心理学系) ; Department of Computer Science, Princeton University(普林斯顿大学计算机科学系) ; Department of Psychology and Center for Computational Language Sciences, University of Southern California(南加州大学心理学系与计算语言科学中心) ; Department of Psychology, Université de Montréal(蒙特利尔大学心理学系)
专题命中 VLM训练与架构 :vision-language model(title,abstract);分类 cs.CV
AI总结 本研究比较了六种视觉语言模型的空间注意力图与人类注视热图,发现解码器架构(LSTM vs Transformer)主导对齐程度,LSTM解码器对齐度更高但空间分散且任务区分度低,而Transformer解码器注意力更集中且任务区分度强。