Video Generation Models are General-Purpose Vision Learners
视频生成模型是通用视觉学习者
机构 * Google DeepMind(谷歌DeepMind)
AI总结 研究探讨计算机视觉中实现通用模型的催化剂,提出大规模文本到视频生成是预训练范式。介绍GenCeption模型,利用视频生成扩散主干定义感知模型。实验表明该模型在多任务中性能领先,有数据效率优势且具涌现行为,为通用视觉智能提供基础路径。
Comments ECCV 2026
大厂专区
视频生成模型是通用视觉学习者
机构 * Google DeepMind(谷歌DeepMind)
AI总结 研究探讨计算机视觉中实现通用模型的催化剂,提出大规模文本到视频生成是预训练范式。介绍GenCeption模型,利用视频生成扩散主干定义感知模型。实验表明该模型在多任务中性能领先,有数据效率优势且具涌现行为,为通用视觉智能提供基础路径。
Comments ECCV 2026
具有部分观测动作的随机线性博弈
机构 * Arizona State University(亚利桑那州立大学) ; GE Vernova(通用电气 Vernova) ; Google(谷歌)
AI总结 研究具有部分观测动作的随机线性博弈问题,提出TOFU-POV算法,通过估计潜在动作子空间等操作,使遗憾为$\sqrt{T}$且与内在维度相关,还设计了秩自适应算法,实验证明该算法能改进自然基线。