Seeing Beyond Words: Self-Supervised Visual Learning for Multimodal Large Language Models
超越文字:面向多模态大语言模型的自监督视觉学习
机构 * University of Modena and Reggio Emilia(摩德纳和雷吉奥艾米利亚大学) ; AMD Silo AI
专题命中 多模态训练与对齐 :multimodal(title,abstract);MLLM(abstract);分类 cs.CV、cs.CL、cs.AI
AI总结 JARVIS通过自监督视觉学习提升多模态大语言模型的视觉推理能力,无需依赖语言监督。