Video Generation Models are General-Purpose Vision Learners
视频生成模型是通用视觉学习者
机构 * Google DeepMind(谷歌DeepMind)
AI总结 研究探讨计算机视觉中实现通用模型的催化剂,提出大规模文本到视频生成是预训练范式。介绍GenCeption模型,利用视频生成扩散主干定义感知模型。实验表明该模型在多任务中性能领先,有数据效率优势且具涌现行为,为通用视觉智能提供基础路径。
Comments ECCV 2026
作者
Computer Vision
视频生成模型是通用视觉学习者
机构 * Google DeepMind(谷歌DeepMind)
AI总结 研究探讨计算机视觉中实现通用模型的催化剂,提出大规模文本到视频生成是预训练范式。介绍GenCeption模型,利用视频生成扩散主干定义感知模型。实验表明该模型在多任务中性能领先,有数据效率优势且具涌现行为,为通用视觉智能提供基础路径。
Comments ECCV 2026
ELF:嵌入式语言流
机构 * MIT(麻省理工学院)
AI总结 本文提出ELF,一种基于连续时间流匹配的连续嵌入空间扩散模型,通过最小调整即可在离散领域有效工作,实验显示其在生成质量与采样步骤上优于现有模型。
Comments Tech report. arXiv v2: add distillation results in Appendix B. https://linlu-qiu.github.io/assets/html/elf_pd.html
图像生成器是通用视觉学习者
机构 * Google(谷歌)
AI总结 本文研究了图像生成器在视觉理解中的通用学习能力,通过引入Vision Banana模型,展示了图像生成训练如何像语言模型预训练一样,使模型在多种视觉任务中取得最佳性能,证明了图像生成预训练在构建基础视觉模型中的核心作用。
Comments Project Page: http://vision-banana.github.io
GeoPT:通过提升几何预训练实现物理模拟的扩展
机构 * MIT CSAIL ; Tsinghua University(清华大学)
AI总结 本文提出GeoPT,一种基于提升几何预训练的通用物理模拟预训练模型,通过合成动态增强几何,实现动态感知的自监督学习,从而提升物理模拟的效率和效果。
Comments Project Page: https://physics-scaling.github.io/GeoPT/
无需潜在变量的一步图像生成:像素均值流
机构 * MIT(麻省理工学院)
AI总结 本文提出像素均值流(pMF),通过分离网络输出空间与损失空间,实现无需潜在变量的一步图像生成,在ImageNet上取得优异结果。
Comments Tech report. Code at https://github.com/Lyy-iiis/pMF
改进的均值流:关于快速前向生成模型挑战的研究
机构 * CMU(卡内基梅隆大学) ; MIT(麻省理工学院) ; Adobe(Adobe公司) ; THU(清华大学)
AI总结 本文改进了MeanFlow框架,通过重新参数化训练目标和指导机制,提升了训练稳定性与灵活性,实现了在ImageNet上的1.72 FID成绩。
Comments Technical report. Code at https://github.com/Lyy-iiis/imeanflow
通过漂移进行生成建模
机构 * MIT(麻省理工学院) ; Harvard University(哈佛大学)
AI总结 本文提出漂移模型,通过在训练过程中演进化分布实现一步生成,取得ImageNet上优异的生成效果。
Comments Project page: https://lambertae.github.io/projects/drifting/
回归基础:让去噪生成模型去噪
机构 * MIT(麻省理工学院)
AI总结 本文提出通过直接预测干净数据的JiT模型,在高维空间中实现有效的去噪生成模型,展示在ImageNet上取得竞争性结果。
Comments Tech report. Code at https://github.com/LTH14/JiT
双向归一化流:从数据到噪声和回
机构 * MIT(麻省理工学院) ; Tsinghua University(清华大学)
AI总结 本文提出BiFlow,一种无需精确解析反演的双向归一化流框架,通过学习反向模型提升生成质量并加速采样,实现更灵活的损失函数和架构,在生成建模中取得优异性能。
Comments Tech report
机构 * MIT(麻省理工学院)
Comments Technical Report. Project webpage: https://github.com/lillian039/VARC
机构 * MIT(麻省理工学院)
Comments Update ImageNet experiments (SiT with CFG). Update Appendix
Journal ref Proceedings of the 42nd International Conference on Machine Learning (ICML), 2025
机构 * MIT(麻省理工学院)
机构 * FAIR, Meta(FAIR与Meta公司) ; New York University(纽约大学) ; MIT(麻省理工学院) ; Princeton University(普林斯顿大学)
Comments CVPR 2025; Project page: https://jiachenzhu.github.io/DyT/
机构 * CMU(卡内基梅隆大学) ; MIT(麻省理工学院)
Comments Tech report
Comments Published in ICLR 2025 (Oral Presentation)
Comments Neurips 2024 (Spotlight). Code: https://github.com/LTH14/mar
Comments Neurips 2024 (Oral)
Comments Tech report
Comments See the project website (https://liruiw.github.io/hpt/) for code and videos
Journal ref Neurips 2024
Comments Technical report, 10 pages
Comments Tech report
Comments Tech report; arXiv v2: update scaling results and add code repo
Comments Tech report. arXiv v2: add RetinaNet results
Comments Tech report. arXiv v2: add more transfer learning results; v3: add robustness evaluation