FlashVLM: Text-Guided Visual Token Selection for Large Multimodal Models
FlashVLM: 大规模多模态模型中的文本引导视觉令牌选择
机构 * Sun Yat-sen University(中山大学) ; University of California, San Diego(加州大学圣地亚哥分校) ; Snap Inc.(Snap公司)
专题命中 VLM训练与架构 :vision-language model(abstract);LLaVA(abstract);分类 cs.CV
AI总结 FlashVLM通过文本引导的视觉令牌选择,实现了高效压缩和高准确率,在大规模多模态模型中表现出色。
Comments Under submission