Chain-of-Visual-Thought: Teaching VLMs to See and Think Better with Continuous Visual Tokens
链式视觉思维:通过连续视觉标记教学VLMs更好地看到和思考
机构 * UC Berkeley(加州大学伯克利分校) ; UCLA(洛杉矶大学) ; Panasonic AI Research(松下人工智能研究)
AI总结 COVT通过连续视觉标记提升VLMs的视觉推理能力,使模型在多个基准测试中性能提升3%-16%。
Comments Project page: https://wakalsprojectpage.github.io/covt-website/