EvoVid: Temporal-Centric Self-Evolution for Video Large Language Models
EvoVid: 以时间为中心的自我进化用于视频大语言模型
机构 * School of Electrical and Electronic Engineering, Nanyang Technological University(南洋理工大学电子与电气工程学院) ; ByteDance(字节跳动)
AI总结 本文提出EvoVid,一种以时间为中心的自我进化框架,使视频大语言模型能够直接从未经标注的视频中改进。通过引入两个互补的时间感知奖励,即时间感知的问题生成奖励和时间基础的求解奖励,EvoVid在四个基础模型和六个基准测试中实现了优于基线模型和现有自我进化基线的改进,展示了时间为中心的自我进化在视频理解和推理中的有效性。
Comments Project page: https://huangshiqi128.github.io/EvoVid.io/