VisMem: Latent Vision Memory Unlocks Potential of Vision-Language Models
VisMem: 通过潜在视觉记忆解锁视觉-语言模型的潜力
机构 * National University of Singapore(新加坡国立大学) ; Fudan University(复旦大学) ; Tsinghua University(清华大学) ; Zhejiang University(浙江大学) ; University of Science and Technology of China(中国科学技术大学) ; vivo
专题命中 视觉定位与Grounding :vision-language model(title,abstract);grounding(abstract);分类 cs.CV、cs.AI、cs.LG
AI总结 VisMem通过引入动态潜在视觉记忆模块,提升视觉-语言模型在复杂视觉任务中的性能,实现感知准确性和语义一致性之间的平衡。