Seeing Beyond Words: Self-Supervised Visual Learning for Multimodal Large Language Models
超越文字:面向多模态大语言模型的自监督视觉学习
机构 * University of Modena and Reggio Emilia(摩德纳和雷吉奥艾米利亚大学) ; AMD Silo AI
专题命中 指令微调 :large language model(title,abstract);language model(title,abstract);LLM(abstract);foundation model(abstract)
AI总结 JARVIS通过自监督视觉学习提升多模态大语言模型的视觉推理能力,无需依赖语言监督。