VisPlay: Self-Evolving Vision-Language Models from Images
VisPlay: 从图像中自我进化视觉-语言模型
机构 * University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) ; Washington University in St. Louis(华盛顿大学圣路易斯分校) ; University of Maryland(马里兰大学) ; National University of Singapore(新加坡国立大学)
专题命中 视觉推理 :vision-language model(title,abstract);VLM(abstract);visual reasoning(abstract);分类 cs.CV、cs.AI、cs.LG
AI总结 VisPlay通过自我进化强化学习框架,利用未标注图像数据提升视觉-语言模型的推理能力,实现多模态智能的可扩展发展。