Video Generation Models are General-Purpose Vision Learners
视频生成模型是通用视觉学习者
机构 * Google DeepMind(谷歌DeepMind)
AI总结 研究探讨计算机视觉中实现通用模型的催化剂,提出大规模文本到视频生成是预训练范式。介绍GenCeption模型,利用视频生成扩散主干定义感知模型。实验表明该模型在多任务中性能领先,有数据效率优势且具涌现行为,为通用视觉智能提供基础路径。
Comments ECCV 2026
作者
Computer Vision
视频生成模型是通用视觉学习者
机构 * Google DeepMind(谷歌DeepMind)
AI总结 研究探讨计算机视觉中实现通用模型的催化剂,提出大规模文本到视频生成是预训练范式。介绍GenCeption模型,利用视频生成扩散主干定义感知模型。实验表明该模型在多任务中性能领先,有数据效率优势且具涌现行为,为通用视觉智能提供基础路径。
Comments ECCV 2026