Toward Cognitive Supersensing in Multimodal Large Language Model
迈向多模态大语言模型的认知超感知
机构 * University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校)
专题命中 视觉问答 :multimodal large language model(title,abstract);visual reasoning(abstract);visual question answering(abstract);分类 cs.CV、cs.AI
AI总结 本文提出认知超感知方法,通过整合视觉图像预测头和强化学习阶段,提升多模态大语言模型在复杂认知任务中的表现,展现其在视觉问答基准中的优越性能。