Video-as-Answer: Predict and Generate Next Video Event with Joint-GRPO
视频作答:联合GRPO预测并生成下一个视频事件
机构 * City University of Hong Kong(香港城市大学) ; Kling Team, Kuaishou Technology(快手技术 Kling 团队)
专题命中 视觉推理 :vision-language model(abstract);VLM(abstract);分类 cs.CV
AI总结 VANS通过联合GRPO方法,利用强化学习对齐视觉-语言模型与视频扩散模型,实现视频下一个事件预测任务的高精度视频生成与描述生成。
Comments Project page: https://video-as-answer.github.io/