VTok: A Unified Video Tokenizer with Decoupled Spatial-Temporal Latents
VTok: 一种具有解耦空间-时间潜在变量的统一视频分词器
机构 * Johns Hopkins University(约翰斯·霍普金斯大学)
专题命中 视频理解 :video generation(abstract);video understanding(abstract);text-to-video(abstract);分类 cs.CV
AI总结 VTok通过解耦空间和时间潜在变量,实现紧凑且高效的视频分词,提升视频理解和生成任务的性能与效率。