arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

视频大模型

视频理解、视频生成、视频语言模型和时序视觉推理。

2026-02-05 至 2026-02-05 共收录 1 信号源:cs.CV, eess.IV, cs.MM

1. 视频理解 1 篇

2602.04202 2026-02-05 cs.CV 77%

VTok: A Unified Video Tokenizer with Decoupled Spatial-Temporal Latents

VTok: 一种具有解耦空间-时间潜在变量的统一视频分词器

Feng Wang, Yichun Shi, Ceyuan Yang, Qiushan Guo, Jingxiang Sun, Alan Yuille, Peng Wang

机构 * Johns Hopkins University(约翰斯·霍普金斯大学)

专题命中 视频理解 :video generation(abstract);video understanding(abstract);text-to-video(abstract);分类 cs.CV

AI总结 VTok通过解耦空间和时间潜在变量,实现紧凑且高效的视频分词,提升视频理解和生成任务的性能与效率。

详情

展开后加载摘要…

URL PDF HTML 收藏