TTRV: Test-Time Reinforcement Learning for Vision Language Models
TTRV:用于视觉语言模型的测试时间强化学习
机构 * IISc Bangalore(班加罗尔印度理工学院) ; JKU Linz(林茨约翰·凯撒大学) ; Stanford(斯坦福大学) ; Tübingen AI Center(图宾根人工智能中心) ; MIT-IBM Watson AI Lab(麻省理工-IBM沃森人工智能实验室) ; MIT CSAIL Project(麻省理工CSAIL项目)
专题命中 视觉问答 :vision language model(title);InternVL(abstract);visual question answering(abstract);分类 cs.CV
AI总结 TTRV通过测试时间强化学习提升视觉语言模型的识别和问答性能,无需标记数据,在多个任务中取得显著提升。