arXivDaily arXiv每日学术速递 周一至周五更新

作者

Kaiming He

Computer Vision

共收录 80 篇
2607.09024 2026-07-13 cs.CV cs.AI 新提交

Video Generation Models are General-Purpose Vision Learners

视频生成模型是通用视觉学习者

Letian Wang, Chuhan Zhang, Rishabh Kabra, Jasper Uijlings, Steven Waslander, Andrew Zisserman, Joao Carreira, Kaiming He, Misha Andriluka, Eduard Gabriel Bazavan, Andrei Zanfir, Cristian Sminchisescu

机构 * Google DeepMind(谷歌DeepMind)

AI总结 研究探讨计算机视觉中实现通用模型的催化剂,提出大规模文本到视频生成是预训练范式。介绍GenCeption模型,利用视频生成扩散主干定义感知模型。实验表明该模型在多任务中性能领先,有数据效率优势且具涌现行为,为通用视觉智能提供基础路径。

Comments ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.10938 2026-06-29 cs.CL cs.AI cs.LG 版本更新

ELF: Embedded Language Flows

ELF:嵌入式语言流

Keya Hu, Linlu Qiu, Yiyang Lu, Hanhong Zhao, Tianhong Li, Yoon Kim, Jacob Andreas, Kaiming He

机构 * MIT(麻省理工学院)

AI总结 本文提出ELF,一种基于连续时间流匹配的连续嵌入空间扩散模型,通过最小调整即可在离散领域有效工作,实验显示其在生成质量与采样步骤上优于现有模型。

Comments Tech report. arXiv v2: add distillation results in Appendix B. https://linlu-qiu.github.io/assets/html/elf_pd.html

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.20329 2026-06-05 cs.CV cs.AI

Image Generators are Generalist Vision Learners

图像生成器是通用视觉学习者

Valentin Gabeur, Shangbang Long, Songyou Peng, Paul Voigtlaender, Shuyang Sun, Yanan Bao, Karen Truong, Zhicheng Wang, Wenlei Zhou, Jonathan T. Barron, Kyle Genova, Nithish Kannen, Sherry Ben, Yandong Li, Mandy Guo, Suhas Yogin, Yiming Gu, Huizhong Chen, Oliver Wang, Saining Xie, Howard Zhou, Kaiming He, Thomas Funkhouser, Jean-Baptiste Alayrac, Radu Soricut

机构 * Google(谷歌)

AI总结 本文研究了图像生成器在视觉理解中的通用学习能力,通过引入Vision Banana模型,展示了图像生成训练如何像语言模型预训练一样,使模型在多种视觉任务中取得最佳性能,证明了图像生成预训练在构建基础视觉模型中的核心作用。

Comments Project Page: http://vision-banana.github.io

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.20399 2026-05-21 cs.LG

GeoPT: Scaling Physics Simulation via Lifted Geometric Pre-Training

GeoPT:通过提升几何预训练实现物理模拟的扩展

Haixu Wu, Minghao Guo, Zongyi Li, Zhiyang Dou, Mingsheng Long, Kaiming He, Wojciech Matusik

机构 * MIT CSAIL ; Tsinghua University(清华大学)

AI总结 本文提出GeoPT,一种基于提升几何预训练的通用物理模拟预训练模型,通过合成动态增强几何,实现动态感知的自监督学习,从而提升物理模拟的效率和效果。

Comments Project Page: https://physics-scaling.github.io/GeoPT/

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.22158 2026-05-12 cs.CV

One-step Latent-free Image Generation with Pixel Mean Flows

无需潜在变量的一步图像生成:像素均值流

Yiyang Lu, Susie Lu, Qiao Sun, Hanhong Zhao, Zhicheng Jiang, Xianbang Wang, Tianhong Li, Zhengyang Geng, Kaiming He

机构 * MIT(麻省理工学院)

AI总结 本文提出像素均值流(pMF),通过分离网络输出空间与损失空间,实现无需潜在变量的一步图像生成,在ImageNet上取得优异结果。

Comments Tech report. Code at https://github.com/Lyy-iiis/pMF

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.02012 2026-05-12 cs.CV cs.LG

Improved Mean Flows: On the Challenges of Fastforward Generative Models

改进的均值流:关于快速前向生成模型挑战的研究

Zhengyang Geng, Yiyang Lu, Zongze Wu, Eli Shechtman, J. Zico Kolter, Kaiming He

机构 * CMU(卡内基梅隆大学) ; MIT(麻省理工学院) ; Adobe(Adobe公司) ; THU(清华大学)

AI总结 本文改进了MeanFlow框架,通过重新参数化训练目标和指导机制,提升了训练稳定性与灵活性,实现了在ImageNet上的1.72 FID成绩。

Comments Technical report. Code at https://github.com/Lyy-iiis/imeanflow

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.04770 2026-02-09 cs.LG cs.CV

Generative Modeling via Drifting

通过漂移进行生成建模

Mingyang Deng, He Li, Tianhong Li, Yilun Du, Kaiming He

机构 * MIT(麻省理工学院) ; Harvard University(哈佛大学)

AI总结 本文提出漂移模型,通过在训练过程中演进化分布实现一步生成,取得ImageNet上优异的生成效果。

Comments Project page: https://lambertae.github.io/projects/drifting/

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.13720 2026-01-08 cs.CV

Back to Basics: Let Denoising Generative Models Denoise

回归基础:让去噪生成模型去噪

Tianhong Li, Kaiming He

机构 * MIT(麻省理工学院)

AI总结 本文提出通过直接预测干净数据的JiT模型,在高维空间中实现有效的去噪生成模型,展示在ImageNet上取得竞争性结果。

Comments Tech report. Code at https://github.com/LTH14/JiT

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.10953 2025-12-12 cs.LG cs.CV

Bidirectional Normalizing Flow: From Data to Noise and Back

双向归一化流:从数据到噪声和回

Yiyang Lu, Qiao Sun, Xianbang Wang, Zhicheng Jiang, Hanhong Zhao, Kaiming He

机构 * MIT(麻省理工学院) ; Tsinghua University(清华大学)

AI总结 本文提出BiFlow,一种无需精确解析反演的双向归一化流框架,通过学习反向模型提升生成质量并加速采样,实现更灵活的损失函数和架构,在生成建模中取得优异性能。

Comments Tech report

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.14761 2025-11-19 cs.CV cs.AI cs.LG

ARC Is a Vision Problem!

ARC是视觉问题!

Keya Hu, Ali Cy, Linlu Qiu, Xiaoman Delores Ding, Runqian Wang, Yeyin Eva Zhu, Jacob Andreas, Kaiming He

机构 * MIT(麻省理工学院)

AI总结 针对ARC被误作语言问题的现状,本研究将其构建为图像到图像转换问题,用“画布”表示输入并应用ViT架构,仅基于ARC数据从头训练并结合测试时训练,在ARC-1基准上达60.4%准确率,显著优于同类方法且接近人类平均水平。

Comments Technical Report. Project webpage: https://github.com/lillian039/VARC

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.13129 2025-11-19 cs.CV

Is Noise Conditioning Necessary for Denoising Generative Models?

噪声条件对于去噪生成模型是必要的吗?

Qiao Sun, Zhicheng Jiang, Hanhong Zhao, Kaiming He

机构 * MIT(麻省理工学院)

AI总结 本研究挑战去噪生成模型需噪声条件的固有认知,通过理论与实验验证无噪声条件模型的可行性,提出的无噪声条件模型在CIFAR-10上取得2.23的FID,性能接近主流噪声条件模型。

Comments Update ImageNet experiments (SiT with CFG). Update Appendix

Journal ref Proceedings of the 42nd International Conference on Machine Learning (ICML), 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.09027 2025-07-25 cs.CV cs.AI cs.LG

Diffuse and Disperse: Image Generation with Representation Regularization

扩散与弥散:基于表示正则化的图像生成

Runqian Wang, Kaiming He

机构 * MIT(麻省理工学院)

AI总结 本文提出即插即用的 Dispersive Loss,通过促使扩散模型内部表示在隐藏空间弥散来提供显式正则化,无需预训练、额外参数或外部数据,并在 ImageNet 多模型实验中稳定优于强基线。

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.10622 2025-06-17 cs.LG cs.AI cs.CL cs.CV

Transformers without Normalization

无归一化的Transformer

Jiachen Zhu, Xinlei Chen, Kaiming He, Yann LeCun, Zhuang Liu

机构 * FAIR, Meta(FAIR与Meta公司) ; New York University(纽约大学) ; MIT(麻省理工学院) ; Princeton University(普林斯顿大学)

AI总结 本研究提出逐元素运算Dynamic Tanh(DyT)以替换Transformer中的归一化层,在多类任务与领域中实现了匹配或超越带归一化模型的性能,挑战了归一化层不可或缺的传统认知。

Comments CVPR 2025; Project page: https://jiachenzhu.github.io/DyT/

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.13447 2025-05-20 cs.LG cs.CV

Mean Flows for One-step Generative Modeling

用于单步生成建模的均值流(Mean Flows)

Zhengyang Geng, Mingyang Deng, Xingjian Bai, J. Zico Kolter, Kaiming He

机构 * CMU(卡内基梅隆大学) ; MIT(麻省理工学院)

AI总结 该研究提出单步生成建模框架MeanFlow,引入平均速度表征流场,利用平均与瞬时速度的恒等式指导训练,无需预训练等,在ImageNet 256x256上以1-NFE取得3.43的FID,优于此前单步扩散/流模型,缩小了与多步模型的差距。

Comments Tech report

详情

展开后加载摘要…

URL PDF HTML 收藏
2405.20283 2025-04-09 cs.CV cs.GR

TetSphere Splatting: Representing High-Quality Geometry with Lagrangian Volumetric Meshes

TetSphere Splatting:用拉格朗日体积网格表示高质量几何

Minghao Guo, Bohan Wang, Kaiming He, Wojciech Matusik

机构 * MIT CSAIL(麻省理工学院计算机科学与人工智能实验室)

AI总结 本文提出TetSphere Splatting,一种基于体积四面体网格变形的拉格朗日几何表示方法,通过几何正则化与约束提升网格质量,并在重建与生成任务中验证了其精度与通用性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.07596 2025-03-11 cs.LG cs.AI

Denoising Hamiltonian Network for Physical Reasoning

用于物理推理的去噪哈密顿网络

Congyue Deng, Brandon Y. Feng, Cecilia Garraffo, Alan Garbarz, Robin Walters, William T. Freeman, Leonidas Guibas, Kaiming He

机构 * Massachusetts Institute of Technology(麻省理工学院) ; Stanford University(斯坦福大学) ; Harvard-Smithsonian Center for Astrophysics(哈佛-史密森尼天体物理中心) ; Northeastern University(东北大学)

AI总结 本文提出去噪哈密顿网络(DHN),通过去噪机制和全局条件机制推广哈密顿力学算子,以捕获非局部时间关系、减少积分误差并支持多系统建模,在多个物理推理任务上验证了其有效性与灵活性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2403.08632 2025-03-04 cs.CV cs.LG

A Decade's Battle on Dataset Bias: Are We There Yet?

关于数据集偏差的十年之战:我们到达终点了吗?

Zhuang Liu, Kaiming He

机构 * Meta AI Research(Meta AI研究院) ; MIT(麻省理工学院)

AI总结 本文重新审视十年前的数据集分类实验,发现现代神经网络在识别图像来源数据集上准确率极高(如三向分类达84.7%),且能学习到可泛化和迁移的语义特征,呼吁社区重新思考数据集偏差问题。

Comments Published in ICLR 2025 (Oral Presentation)

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.17437 2025-02-26 cs.LG cs.CV

Fractal Generative Models

分形生成模型

Tianhong Li, Qinyi Sun, Lijie Fan, Kaiming He

机构 * MIT CSAIL(麻省理工学院计算机科学与人工智能实验室) ; Google DeepMind(谷歌DeepMind)

AI总结 本文提出分形生成模型,通过递归调用原子生成模块(如自回归模型)构建自相似架构,在逐像素图像生成任务上展现出优异的似然估计与生成质量,开辟了生成建模的新范式。

详情

展开后加载摘要…

URL PDF HTML 收藏
2405.20510 2025-01-03 cs.CV

Physically Compatible 3D Object Modeling from a Single Image

从单张图像进行物理兼容的三维物体建模

Minghao Guo, Bohan Wang, Pingchuan Ma, Tianyuan Zhang, Crystal Elaine Owens, Chuang Gan, Joshua B. Tenenbaum, Kaiming He, Wojciech Matusik

机构 * MIT BCS(麻省理工学院脑与认知科学系) ; Center for Brains, Minds and Machines(大脑、心智与机器中心)

AI总结 本文提出一种从单张图像重建物理兼容三维物体的优化框架,通过显式分解力学属性、外力和静止形状并以静态平衡为硬约束,在Objaverse数据集上验证了其提升物理真实感的有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2406.11838 2024-11-04 cs.CV

Autoregressive Image Generation without Vector Quantization

无需向量量化的自回归图像生成

Tianhong Li, Yonglong Tian, He Li, Mingyang Deng, Kaiming He

机构 * MIT CSAIL(麻省理工学院计算机科学与人工智能实验室) ; Google DeepMind(谷歌DeepMind) ; Tsinghua University(清华大学)

AI总结 该研究打破自回归图像生成需依赖向量量化的传统认知,提出用扩散过程建模token概率、以扩散损失替代交叉熵损失的方法,实现了连续空间下的自回归图像生成,效果优异且兼具速度优势。

Comments Neurips 2024 (Spotlight). Code: https://github.com/LTH14/mar

详情

展开后加载摘要…

URL PDF HTML 收藏
2312.03701 2024-11-04 cs.CV

Return of Unconditional Generation: A Self-supervised Representation Generation Method

无条件生成的回归:一种自监督表征生成方法

Tianhong Li, Dina Katabi, Kaiming He

机构 * MIT CSAIL(麻省理工学院计算机科学与人工智能实验室)

AI总结 针对无条件生成质量低于条件生成的问题,提出表征条件生成框架RCG,通过自监督编码器的表征空间生成语义表征为图像生成器提供条件,在ImageNet 256×256上取得FID 2.15的SOTA,大幅缩小与条件生成的差距。

Comments Neurips 2024 (Oral)

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.13863 2024-10-18 cs.CV cs.LG

Fluid: Scaling Autoregressive Text-to-image Generative Models with Continuous Tokens

Fluid:利用连续令牌扩展自回归文本到图像生成模型

Lijie Fan, Tianhong Li, Siyang Qin, Yuanzhen Li, Chen Sun, Michael Rubinstein, Deqing Sun, Kaiming He, Yonglong Tian

机构 * Google DeepMind(谷歌DeepMind) ; MIT(麻省理工学院)

AI总结 本文研究文本到图像生成中自回归模型的扩展问题,发现连续令牌和随机生成顺序能显著提升视觉质量与GenEval分数,据此提出Fluid模型,在MS-COCO 30K上取得零样本FID 6.16的新最优结果。

Comments Tech report

详情

展开后加载摘要…

URL PDF HTML 收藏
2409.20537 2024-10-01 cs.RO cs.CV cs.LG

Scaling Proprioceptive-Visual Learning with Heterogeneous Pre-trained Transformers

利用异构预训练Transformer扩展本体感知-视觉学习

Lirui Wang, Xinlei Chen, Jialiang Zhao, Kaiming He

机构 * MIT CSAIL(麻省理工学院计算机科学与人工智能实验室) ; Meta, FAIR(元公司 FAIR)

AI总结 本文提出异构预训练Transformer(HPT),通过跨52个数据集的大规模异构预训练学习与任务和具体形态无关的共享策略表示,在多个仿真和真实世界未见任务上性能提升超过20%。

Comments See the project website (https://liruiw.github.io/hpt/) for code and videos

Journal ref Neurips 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2405.16380 2024-05-28 cs.LG quant-ph

Dynamic Inhomogeneous Quantum Resource Scheduling with Reinforcement Learning

Linsen Li, Pratyush Anand, Kaiming He, Dirk Englund

详情

展开后加载摘要…

URL PDF HTML 收藏
2401.14404 2024-01-26 cs.CV cs.LG

Deconstructing Denoising Diffusion Models for Self-Supervised Learning

Xinlei Chen, Zhuang Liu, Saining Xie, Kaiming He

机构 * FAIR, Meta(Meta 基础人工智能研究中心) ; New York University(纽约大学)

Comments Technical report, 10 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
1605.06409 2023-12-12 cs.CV

R-FCN: Object Detection via Region-based Fully Convolutional Networks

Jifeng Dai, Yi Li, Kaiming He, Jian Sun

机构 * Microsoft Research Asia(微软亚洲研究院) ; Tsinghua University(清华大学) ; Microsoft Research(微软研究院)

Comments Tech report

详情

展开后加载摘要…

URL PDF HTML 收藏
2212.00794 2023-03-31 cs.CV

Scaling Language-Image Pre-training via Masking

Yanghao Li, Haoqi Fan, Ronghang Hu, Christoph Feichtenhofer, Kaiming He

机构 * Meta AI ; FAIR(基础人工智能研究)

Comments Tech report; arXiv v2: update scaling results and add code repo

详情

展开后加载摘要…

URL PDF HTML 收藏
2205.09113 2022-10-24 cs.CV cs.LG

Masked Autoencoders As Spatiotemporal Learners

Christoph Feichtenhofer, Haoqi Fan, Yanghao Li, Kaiming He

机构 * Meta AI ; FAIR(Facebook人工智能研究院)

详情

展开后加载摘要…

URL PDF HTML 收藏
2203.16527 2022-06-13 cs.CV

Exploring Plain Vision Transformer Backbones for Object Detection

Yanghao Li, Hanzi Mao, Ross Girshick, Kaiming He

机构 * Facebook AI Research(脸书人工智能研究院)

Comments Tech report. arXiv v2: add RetinaNet results

详情

展开后加载摘要…

URL PDF HTML 收藏
2111.06377 2021-12-21 cs.CV

Masked Autoencoders Are Scalable Vision Learners

Kaiming He, Xinlei Chen, Saining Xie, Yanghao Li, Piotr Dollár, Ross Girshick

机构 * Facebook AI Research (FAIR)(Facebook 人工智能研究院)

Comments Tech report. arXiv v2: add more transfer learning results; v3: add robustness evaluation

详情

展开后加载摘要…

URL PDF HTML 收藏
↑