Rethinking the Text-Vision Reasoning Imbalance in MLLMs through the Lens of Training Recipes
通过训练食谱的视角重新思考MLLMs中的文本-视觉推理不平衡
机构 * UC Santa Barbara(加州大学圣芭芭拉分校) ; MIT-IBM Watson AI Lab(麻省理工-IBM Watson人工智能实验室) ; Adobe Research(Adobe研究院)
专题命中 视觉空间推理 :reasoning(title,abstract);分类 cs.AI
AI总结 本文通过分析训练食谱,提出减少多模态大语言模型中文本与视觉推理不平衡的方法,旨在提升视觉推理能力。