GazeVLM: Active Vision via Internal Attention Control for Multimodal Reasoning
GazeVLM:通过内部注意力控制实现多模态推理的主动视觉
机构 * IBM Research(IBM研究院) ; ETH Zurich(苏黎世联邦理工学院) ; TU Wien(维也纳技术大学)
AI总结 GazeVLM通过内部注意力控制实现主动视觉,使模型在多模态推理中实现从全局空间感知到局部聚焦推理的无缝切换,无需外部工具或增加视觉token。