Video Generation Models are General-Purpose Vision Learners
视频生成模型是通用视觉学习者
机构 * Google DeepMind(谷歌DeepMind)
AI总结 研究探讨计算机视觉中实现通用模型的催化剂,提出大规模文本到视频生成是预训练范式。介绍GenCeption模型,利用视频生成扩散主干定义感知模型。实验表明该模型在多任务中性能领先,有数据效率优势且具涌现行为,为通用视觉智能提供基础路径。
Comments ECCV 2026
作者
Computer Vision
视频生成模型是通用视觉学习者
机构 * Google DeepMind(谷歌DeepMind)
AI总结 研究探讨计算机视觉中实现通用模型的催化剂,提出大规模文本到视频生成是预训练范式。介绍GenCeption模型,利用视频生成扩散主干定义感知模型。实验表明该模型在多任务中性能领先,有数据效率优势且具涌现行为,为通用视觉智能提供基础路径。
Comments ECCV 2026
ELF:嵌入式语言流
机构 * MIT(麻省理工学院)
AI总结 本文提出ELF,一种基于连续时间流匹配的连续嵌入空间扩散模型,通过最小调整即可在离散领域有效工作,实验显示其在生成质量与采样步骤上优于现有模型。
Comments Tech report. arXiv v2: add distillation results in Appendix B. https://linlu-qiu.github.io/assets/html/elf_pd.html
图像生成器是通用视觉学习者
机构 * Google(谷歌)
AI总结 本文研究了图像生成器在视觉理解中的通用学习能力,通过引入Vision Banana模型,展示了图像生成训练如何像语言模型预训练一样,使模型在多种视觉任务中取得最佳性能,证明了图像生成预训练在构建基础视觉模型中的核心作用。
Comments Project Page: http://vision-banana.github.io
GeoPT:通过提升几何预训练实现物理模拟的扩展
机构 * MIT CSAIL ; Tsinghua University(清华大学)
AI总结 本文提出GeoPT,一种基于提升几何预训练的通用物理模拟预训练模型,通过合成动态增强几何,实现动态感知的自监督学习,从而提升物理模拟的效率和效果。
Comments Project Page: https://physics-scaling.github.io/GeoPT/
无需潜在变量的一步图像生成:像素均值流
机构 * MIT(麻省理工学院)
AI总结 本文提出像素均值流(pMF),通过分离网络输出空间与损失空间,实现无需潜在变量的一步图像生成,在ImageNet上取得优异结果。
Comments Tech report. Code at https://github.com/Lyy-iiis/pMF
改进的均值流:关于快速前向生成模型挑战的研究
机构 * CMU(卡内基梅隆大学) ; MIT(麻省理工学院) ; Adobe(Adobe公司) ; THU(清华大学)
AI总结 本文改进了MeanFlow框架,通过重新参数化训练目标和指导机制,提升了训练稳定性与灵活性,实现了在ImageNet上的1.72 FID成绩。
Comments Technical report. Code at https://github.com/Lyy-iiis/imeanflow
通过漂移进行生成建模
机构 * MIT(麻省理工学院) ; Harvard University(哈佛大学)
AI总结 本文提出漂移模型,通过在训练过程中演进化分布实现一步生成,取得ImageNet上优异的生成效果。
Comments Project page: https://lambertae.github.io/projects/drifting/
回归基础:让去噪生成模型去噪
机构 * MIT(麻省理工学院)
AI总结 本文提出通过直接预测干净数据的JiT模型,在高维空间中实现有效的去噪生成模型,展示在ImageNet上取得竞争性结果。
Comments Tech report. Code at https://github.com/LTH14/JiT
双向归一化流:从数据到噪声和回
机构 * MIT(麻省理工学院) ; Tsinghua University(清华大学)
AI总结 本文提出BiFlow,一种无需精确解析反演的双向归一化流框架,通过学习反向模型提升生成质量并加速采样,实现更灵活的损失函数和架构,在生成建模中取得优异性能。
Comments Tech report
ARC是视觉问题!
机构 * MIT(麻省理工学院)
AI总结 针对ARC被误作语言问题的现状,本研究将其构建为图像到图像转换问题,用“画布”表示输入并应用ViT架构,仅基于ARC数据从头训练并结合测试时训练,在ARC-1基准上达60.4%准确率,显著优于同类方法且接近人类平均水平。
Comments Technical Report. Project webpage: https://github.com/lillian039/VARC
噪声条件对于去噪生成模型是必要的吗?
机构 * MIT(麻省理工学院)
AI总结 本研究挑战去噪生成模型需噪声条件的固有认知,通过理论与实验验证无噪声条件模型的可行性,提出的无噪声条件模型在CIFAR-10上取得2.23的FID,性能接近主流噪声条件模型。
Comments Update ImageNet experiments (SiT with CFG). Update Appendix
Journal ref Proceedings of the 42nd International Conference on Machine Learning (ICML), 2025
扩散与弥散:基于表示正则化的图像生成
机构 * MIT(麻省理工学院)
AI总结 本文提出即插即用的 Dispersive Loss,通过促使扩散模型内部表示在隐藏空间弥散来提供显式正则化,无需预训练、额外参数或外部数据,并在 ImageNet 多模型实验中稳定优于强基线。
无归一化的Transformer
机构 * FAIR, Meta(FAIR与Meta公司) ; New York University(纽约大学) ; MIT(麻省理工学院) ; Princeton University(普林斯顿大学)
AI总结 本研究提出逐元素运算Dynamic Tanh(DyT)以替换Transformer中的归一化层,在多类任务与领域中实现了匹配或超越带归一化模型的性能,挑战了归一化层不可或缺的传统认知。
Comments CVPR 2025; Project page: https://jiachenzhu.github.io/DyT/
用于单步生成建模的均值流(Mean Flows)
机构 * CMU(卡内基梅隆大学) ; MIT(麻省理工学院)
AI总结 该研究提出单步生成建模框架MeanFlow,引入平均速度表征流场,利用平均与瞬时速度的恒等式指导训练,无需预训练等,在ImageNet 256x256上以1-NFE取得3.43的FID,优于此前单步扩散/流模型,缩小了与多步模型的差距。
Comments Tech report
TetSphere Splatting:用拉格朗日体积网格表示高质量几何
机构 * MIT CSAIL(麻省理工学院计算机科学与人工智能实验室)
AI总结 本文提出TetSphere Splatting,一种基于体积四面体网格变形的拉格朗日几何表示方法,通过几何正则化与约束提升网格质量,并在重建与生成任务中验证了其精度与通用性。
用于物理推理的去噪哈密顿网络
机构 * Massachusetts Institute of Technology(麻省理工学院) ; Stanford University(斯坦福大学) ; Harvard-Smithsonian Center for Astrophysics(哈佛-史密森尼天体物理中心) ; Northeastern University(东北大学)
AI总结 本文提出去噪哈密顿网络(DHN),通过去噪机制和全局条件机制推广哈密顿力学算子,以捕获非局部时间关系、减少积分误差并支持多系统建模,在多个物理推理任务上验证了其有效性与灵活性。
关于数据集偏差的十年之战:我们到达终点了吗?
机构 * Meta AI Research(Meta AI研究院) ; MIT(麻省理工学院)
AI总结 本文重新审视十年前的数据集分类实验,发现现代神经网络在识别图像来源数据集上准确率极高(如三向分类达84.7%),且能学习到可泛化和迁移的语义特征,呼吁社区重新思考数据集偏差问题。
Comments Published in ICLR 2025 (Oral Presentation)
分形生成模型
机构 * MIT CSAIL(麻省理工学院计算机科学与人工智能实验室) ; Google DeepMind(谷歌DeepMind)
AI总结 本文提出分形生成模型,通过递归调用原子生成模块(如自回归模型)构建自相似架构,在逐像素图像生成任务上展现出优异的似然估计与生成质量,开辟了生成建模的新范式。
从单张图像进行物理兼容的三维物体建模
机构 * MIT BCS(麻省理工学院脑与认知科学系) ; Center for Brains, Minds and Machines(大脑、心智与机器中心)
AI总结 本文提出一种从单张图像重建物理兼容三维物体的优化框架,通过显式分解力学属性、外力和静止形状并以静态平衡为硬约束,在Objaverse数据集上验证了其提升物理真实感的有效性。
无需向量量化的自回归图像生成
机构 * MIT CSAIL(麻省理工学院计算机科学与人工智能实验室) ; Google DeepMind(谷歌DeepMind) ; Tsinghua University(清华大学)
AI总结 该研究打破自回归图像生成需依赖向量量化的传统认知,提出用扩散过程建模token概率、以扩散损失替代交叉熵损失的方法,实现了连续空间下的自回归图像生成,效果优异且兼具速度优势。
Comments Neurips 2024 (Spotlight). Code: https://github.com/LTH14/mar
无条件生成的回归:一种自监督表征生成方法
机构 * MIT CSAIL(麻省理工学院计算机科学与人工智能实验室)
AI总结 针对无条件生成质量低于条件生成的问题,提出表征条件生成框架RCG,通过自监督编码器的表征空间生成语义表征为图像生成器提供条件,在ImageNet 256×256上取得FID 2.15的SOTA,大幅缩小与条件生成的差距。
Comments Neurips 2024 (Oral)
Fluid:利用连续令牌扩展自回归文本到图像生成模型
机构 * Google DeepMind(谷歌DeepMind) ; MIT(麻省理工学院)
AI总结 本文研究文本到图像生成中自回归模型的扩展问题,发现连续令牌和随机生成顺序能显著提升视觉质量与GenEval分数,据此提出Fluid模型,在MS-COCO 30K上取得零样本FID 6.16的新最优结果。
Comments Tech report
利用异构预训练Transformer扩展本体感知-视觉学习
机构 * MIT CSAIL(麻省理工学院计算机科学与人工智能实验室) ; Meta, FAIR(元公司 FAIR)
AI总结 本文提出异构预训练Transformer(HPT),通过跨52个数据集的大规模异构预训练学习与任务和具体形态无关的共享策略表示,在多个仿真和真实世界未见任务上性能提升超过20%。
Comments See the project website (https://liruiw.github.io/hpt/) for code and videos
Journal ref Neurips 2024
机构 * FAIR, Meta(Meta 基础人工智能研究中心) ; New York University(纽约大学)
Comments Technical report, 10 pages
机构 * Microsoft Research Asia(微软亚洲研究院) ; Tsinghua University(清华大学) ; Microsoft Research(微软研究院)
Comments Tech report
机构 * Meta AI ; FAIR(基础人工智能研究)
Comments Tech report; arXiv v2: update scaling results and add code repo
机构 * Meta AI ; FAIR(Facebook人工智能研究院)
机构 * Facebook AI Research(脸书人工智能研究院)
Comments Tech report. arXiv v2: add RetinaNet results
机构 * Facebook AI Research (FAIR)(Facebook 人工智能研究院)
Comments Tech report. arXiv v2: add more transfer learning results; v3: add robustness evaluation