Do Vision Language Models Need to Process Image Tokens?
视觉语言模型是否需要处理图像标记?
机构 * IBM ; Indian Institute of Science(印度科学研究所) ; University of Virginia(弗吉尼亚大学)
AI总结 本文研究了视觉语言模型中图像标记的功能,发现视觉表示快速收敛至有限复杂度,而文本表示持续重构。视觉表示在不同层间可互换,任务依赖性影响视觉处理的必要性。
Comments Accepted (Oral) at TRUE-V Workshop CVPR 2026