Improving Video Diffusion Transformer Training by Multi-Feature Fusion and Alignment from Self-Supervised Vision Encoders
专题命中 视频扩散模型 :video diffusion(title,abstract);video generation(abstract);分类 cs.CV
Comments 17 pages, 14 figures
AI 大模型
视频理解、视频生成、视频语言模型和时序视觉推理。
专题命中 视频扩散模型 :video diffusion(title,abstract);video generation(abstract);分类 cs.CV
Comments 17 pages, 14 figures