UniAnimate: Taming Unified Video Diffusion Models for Consistent Human Image Animation
专题命中 视频扩散模型 :video diffusion(title,abstract);video generation(abstract);分类 cs.CV
Comments Project page: https://unianimate.github.io/
AI 大模型
视频理解、视频生成、视频语言模型和时序视觉推理。
专题命中 视频扩散模型 :video diffusion(title,abstract);video generation(abstract);分类 cs.CV
Comments Project page: https://unianimate.github.io/
专题命中 视频扩散模型 :video diffusion(title,abstract);video generation(abstract);分类 cs.CV
Comments Accepted in CVPR 2024
专题命中 视频扩散模型 :video diffusion(title,abstract);long video(abstract);分类 cs.CV
专题命中 视频扩散模型 :video diffusion(title,abstract);video generation(abstract);分类 cs.CV
Comments ICLR 2024. Project Page: https://llm-grounded-video-diffusion.github.io/
专题命中 视频扩散模型 :video diffusion(title,abstract);video generation(abstract);分类 cs.CV
Comments ICLR 2024. Project page: https://sihyun.me/CMD
专题命中 视频扩散模型 :video generation(title,abstract);video diffusion(abstract);分类 cs.CV
专题命中 视频扩散模型 :video generation(title);video diffusion(abstract);text-to-video(abstract);分类 cs.CV
Comments Project page: https://videoelevator.github.io Code: https://github.com/YBYBZhang/VideoElevator
专题命中 视频扩散模型 :video diffusion(title);video generation(abstract);text-to-video(abstract);分类 cs.CV
Comments Homepage: https://ailab-cvc.github.io/videocrafter; Github: https://github.com/AILab-CVC/VideoCrafter
专题命中 视频扩散模型 :video generation(title);video diffusion(abstract);text-to-video(abstract);分类 cs.CV
Comments Project page: https://primecai.github.io/generative_rendering/
专题命中 视频扩散模型 :video diffusion(title,abstract);text-to-video(abstract);分类 cs.CV
Comments Project page: https://doubiiu.github.io/projects/DynamiCrafter
专题命中 视频扩散模型 :video generation(title,abstract);long video(abstract);分类 cs.CV
Comments 11 pages
专题命中 视频扩散模型 :video diffusion(title,abstract);video generation(abstract);分类 cs.CV
专题命中 视频扩散模型 :video diffusion(title,abstract);video generation(abstract);分类 cs.CV
Comments Accepted for publication at IJCAI 2023. To appear
专题命中 视频扩散模型 :video diffusion(title,abstract);video generation(abstract);分类 cs.CV
AdaptiveLoad: 向高效视频扩散变换器训练迈进
机构 * Tsinghua University(清华大学) ; Peking University(北京大学) ; Tianjin University(天津大学)
专题命中 视频扩散模型 :video diffusion(title,abstract);video generation(abstract)
AI总结 本文提出AdaptiveLoad框架,通过双约束自适应负载平衡系统和融合LayerNorm-Modulate CUDA内核,解决视频生成模型中大规模视频扩散变换器(如DiT和MMDiT)训练中的计算不平衡问题,实验显示其在Wan 2.1世界模型上提升了计算效率和训练吞吐量。
面向视频扩散模型的通信高效服务与潜在并行性
专题命中 视频扩散模型 :video diffusion(title,abstract);video generation(abstract)
AI总结 本文提出潜在并行性策略,通过动态旋转潜在空间维度,显著降低视频扩散模型服务的通信开销,同时保持生成质量。
Comments 19 pages
专题命中 视频扩散模型 :video diffusion(title,abstract);video generation(abstract)
专题命中 视频扩散模型 :video generation(title,abstract);video diffusion(abstract)
Comments 2 pages, 5 figures. SIGGRAPH 2025 Poster
专题命中 视频扩散模型 :video diffusion(title,abstract);video generation(abstract)
机构 * Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所) ; School of Artificial Intelligence, University of Chinese Academy of Sciences(中国科学院大学人工智能学院)
专题命中 视频扩散模型 :text-to-video(title,abstract);video diffusion(abstract)
专题命中 视频扩散模型 :video diffusion(title,abstract);video generation(abstract)
FreeOrbit4D: 通过前景完整4D重建实现免训练的任意相机重定向
机构 * University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) ; University of Pennsylvania(宾夕法尼亚大学) ; Eyeline Labs(Eyeline实验室)
专题命中 视频扩散模型 :video generation(abstract,abstract_cn);video diffusion(abstract,abstract_cn);分类 cs.CV
AI总结 本文提出FreeOrbit4D,一种无需训练的框架,通过恢复完整的前景4D代理来解决大角度重定向中的几何模糊问题,从而生成更真实且时间一致的视频。
Comments 12 pages, 10 figures. Accepted to SIGGRAPH Conference Papers 2026
CachedSearch:用于视频扩散测试时搜索的免训练缓存探索
机构 * The University of Texas at Austin(德克萨斯大学奥斯汀分校)
专题命中 视频扩散模型 :video diffusion(title,abstract);分类 cs.CV、cs.MM
AI总结 研究视频扩散测试时搜索中缓存对候选者排名的影响,提出CachedSearch方法,通过积极缓存探索候选者,仅全计算时重生成获胜者,在多模型多系列中有效提升效率,以低成本获高增益,且免训练、与验证器无关,可用于测试时扩展。
NaviCache: 视频生成的测试时自校准缓存
机构 * Zhejiang University(浙江大学) ; Cornell University(康奈尔大学) ; Tencent Hunyuan(腾讯文生视频)
专题命中 视频扩散模型 :video generation(title);video diffusion(abstract);分类 cs.CV、cs.MM
AI总结 针对视频扩散模型计算成本高的问题,提出NaviCache方法,将特征演化重构思为惯性导航系统问题,通过双状态估计架构自适应跟踪特征变化比和潜在漂移,实现有界误差的计算跳过,在多个模型上取得优异性能。
Comments Published at ICML 2026: Proceedings of the 43rd International Conference on Machine Learning, Seoul, South Korea. PMLR 306, 2026
在视频扩散Transformer中实现时间可编辑性
机构 * Kandinsky Lab(坎迪斯基实验室)
专题命中 视频扩散模型 :video diffusion(title);video generation(abstract);分类 cs.CV、cs.MM
AI总结 提出一种时间控制方法,通过轻量级时间模块扩展预训练DiT,实现运动速度和时序结构的编辑,无需重新设计骨干网络。
量化键窃取注意力:视频扩散中KV缓存压缩的偏差校正
机构 * Technical University of Munich(慕尼黑技术大学) ; Tensordyne
专题命中 视频扩散模型 :video diffusion(title,abstract);分类 cs.CV、eess.IV
AI总结 针对视频扩散模型中KV缓存量化导致注意力权重系统性偏差的问题,提出基于Jensen偏差的在线逐注意力分数校正方法,在INT2量化下恢复接近BF16的视频质量,且内存减半。
Comments Variants of this manuscript were accepted to the ICML 2026 workshops SCALE and F2S
Bernini: 视频扩散中的潜在语义规划
机构 * Bernini Team(伯尼尼团队)
专题命中 视频扩散模型 :video diffusion(title);video generation(abstract);分类 cs.CV、cs.MM
AI总结 本文提出Bernini框架,通过将大规模多模态语言模型用于语义规划,扩散模型用于像素生成,实现了视频生成与编辑的统一方法,提升了编辑任务的泛化能力。
Comments Project Page: https://bernini-ai.github.io/
FreqFormer:具有自适应频谱路由的分层频域注意力机制用于长序列视频扩散变换器
机构 * Beijing University of Posts and Telecommunications(北京邮电大学)
专题命中 视频扩散模型 :video diffusion(title,abstract);分类 cs.CV、eess.IV
AI总结 FreqFormer通过分层频域注意力机制,利用视频特征的频谱结构,采用不同操作符处理不同频段,降低长序列视频扩散变换器的计算与内存开销。
Comments 24 pages, 17 figures, 14 tables, Technical Report
用于联合音频视频生成的扩散模型
专题命中 视频扩散模型 :video generation(title,abstract);分类 cs.CV、cs.MM
AI总结 本文提出联合音频视频生成方法,通过构建高质量数据集、训练MM-扩散架构、探索联合潜在扩散及提出两步文本到音频视频生成流程,提升生成质量与一致性。
何时锁定注意力:视频扩散中的无训练KV控制
专题命中 视频扩散模型 :video diffusion(title,abstract);分类 cs.CV、eess.IV
AI总结 KV-Lock通过动态调度KV融合比和CFG尺度,提升视频扩散模型中前景质量与背景一致性的平衡,实现无训练的高效视频编辑。
Comments 18 pages, 9 figures, 3 tables