Unleashing the Intrinsic Visual Representation Capability of Multimodal Large Language Models
释放多模态大语言模型的内在视觉表示能力
机构 * HUST(华中科技大学) ; Tencent Hunyuan Research(腾讯混元研究) ; HKUST(香港科技大学) ; NJU(南京大学)
专题命中 知识编辑与模型理解 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.AI
AI总结 本文提出LaVer框架,通过掩码图像建模提升多模态大语言模型的视觉表示能力,实验表明其在需要密集视觉能力的场景中表现优异。