Divot: Diffusion Powers Video Tokenizer for Comprehension and Generation
专题命中 视频扩散模型 :video generation(abstract);video diffusion(abstract);text-to-video(abstract);分类 cs.CV
Comments Project released at: https://github.com/TencentARC/Divot
AI 大模型
视频理解、视频生成、视频语言模型和时序视觉推理。
专题命中 视频扩散模型 :video generation(abstract);video diffusion(abstract);text-to-video(abstract);分类 cs.CV
Comments Project released at: https://github.com/TencentARC/Divot
专题命中 视频扩散模型 :video generation(abstract);text-to-video(abstract);long video(abstract);分类 cs.CV
Comments Project Page: https://jjihwan.github.io/projects/FIFO-Diffusion
Journal ref NeurIPS 2024
专题命中 视频扩散模型 :video generation(abstract);video diffusion(abstract);long video(abstract);分类 cs.CV
Comments CVPR 2023. Project page: https://sihyun.me/PVDM
视频扩散模型能否预测过去帧?双向循环一致性用于可逆插值
机构 * School of Software Engineering, Xi'an Jiaotong University(西安交通大学软件工程学院) ; School of Computer and Information Science, Hefei University of Technology(合肥工业大学计算机与信息科学学院) ; Faculty of Science and Technology, University of Macau(澳门大学科技学院)
专题命中 视频扩散模型 :video diffusion(title);分类 cs.CV、cs.MM
AI总结 本文提出双向循环一致性框架,通过双向生成轨迹对称性提升视频插值的时序一致性,实验表明在37帧和73帧任务中取得最佳性能。
UniAnimate-DiT:基于大规模视频扩散变换器的人像图像动画
机构 * Key Laboratory of Image Processing and Intelligent Control, School of Artificial Intelligence and Automation, Huazhong University of Science and Technology(华中科技大学图像处理与智能控制重点实验室,人工智能与自动化学院) ; Alibaba Group(阿里巴巴集团) ; Tsinghua University(清华大学)
专题命中 视频扩散模型 :video diffusion(title);分类 cs.CV、cs.MM
AI总结 本文提出UniAnimate-DiT,利用Wan2.1模型实现一致的人像动画,通过LoRA技术优化参数,设计轻量姿态编码器并整合参考外观,实验表明其能生成高质量且时间一致的动画,支持从480p到720P的超分辨率。
Comments The training and inference code (based on Wan2.1) is available at https://github.com/ali-vilab/UniAnimate-DiT
EchoLVFM: 通过潜在流匹配实现单步视频生成用于超声心动图合成
专题命中 视频扩散模型 :video generation(title);分类 cs.CV、eess.IV
AI总结 本文提出EchoLVFM框架,通过潜在空间单步生成可控的超声心动图视频,提升效率并保持视觉质量,实验证明其在单帧条件下的视频质量与专家判断准确率。
Comments Submitted to MICCAI 2026; Under Review
专题命中 视频扩散模型 :video generation(title);分类 cs.CV、cs.MM
Comments ICLR 2025
多视角视频扩散策略:一种3D空间-时间感知的视频动作模型
机构 * New Laboratory of Pattern Recognition (NLPR), Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所模式识别国家重点实验室) ; School of Artificial Intelligence, University of Chinese Academy of Sciences(中国科学院大学人工智能学院) ; FiveAges(五时代) ; Tsinghua University(清华大学) ; Xi’an Jiaotong University(西安交通大学) ; Wuhan University(武汉大学) ; Nanjing University(南京大学)
专题命中 视频扩散模型 :video diffusion(title);分类 cs.CV
AI总结 本文提出MV-VDP,通过联合建模环境的3D空间-时间状态,解决机器人操控中对3D空间结构和时间演变理解不足的问题,实现高效、鲁棒且可解释的动作执行。
Comments Updated Version; Project Website: https://spatialvam.github.io/
SafeGen:基于视觉语言模型的自动驾驶安全关键场景的目标条件视频扩散
机构 * Beihang University(北京航空航天大学) ; Zhongguancun Laboratory(中关村实验室) ; Chery Automobile Co., Ltd.(奇瑞汽车股份有限公司)
专题命中 视频扩散模型 :video diffusion(title);分类 cs.CV
AI总结 研究针对VLM在自动驾驶系统中的应用,提出SafeGen框架,将场景生成设为目标条件扩散过程,引入上下文接地最终状态推理和最终状态条件下的视频演化,实验表明该框架能提升评判得分,微调后可提高真实驾驶场景性能。
AHOY! 从YouTube视频中通过高斯点云和视频扩散先验构建可动画的遮挡人类
机构 * University of Tübingen(图宾根大学) ; Imperial College London(帝国理工学院) ; KAUST(阿卜杜拉国王科技大学)
专题命中 视频扩散模型 :video diffusion(title);分类 cs.CV
AI总结 本文提出AHOY方法,通过高斯点云和视频扩散先验从真实视频中重建完整可动画3D人体,解决遮挡挑战,提出四点贡献:生成监督、两阶段架构、解耦策略、头身监督。
Comments ECCV 2026. Project page is available at https://miraymen.github.io/ahoy/
Ocean4D:通过介质感知视频扩散的生成式水下4D重建
机构 * Faculty of Information Science and Engineering, Ocean University of China(中国海洋大学信息科学与工程学部) ; Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所)
专题命中 视频扩散模型 :video diffusion(title);分类 cs.CV
AI总结 提出Ocean4D生成式框架,通过4D几何一致性条件化和介质感知去噪扩散,解决水下动态场景中吸收与散射导致的几何不稳定和跨视角不一致问题,实现单目视频到目标轨迹的高质量4D重建。
ORBIS: 通过分布感知匹配的输出引导标记减少以加速视频扩散
机构 * KAIST(韩国科学技术院)
专题命中 视频扩散模型 :video diffusion(title);分类 cs.CV
AI总结 本文提出ORBIS,一种针对视频扩散Transformer的SW-HW协同设计加速器,通过利用前一时间步的输出激活获得更准确的token相似性,从而提高匹配质量并实现更高的标记减少比例,同时引入分布感知标记匹配算法和专用硬件设计,实现比现有方法更高的标记减少率、更快的速度和更低的能耗。
MoZoo:释放视频扩散在动物毛发和肌肉模拟中的潜力
机构 * tabular c 1 Tsinghua University 2 University of Glasgow 3 The Chinese University of Hong Kong 4 HUIJING Digital Media \& Entertainment Group 2mm Project Page: tabular
专题命中 视频扩散模型 :video diffusion(title);分类 cs.CV
AI总结 MoZoo通过引入Role-Aware RoPE和Asymmetric Decoupled Attention,实现高保真动物视频生成,同时构建了MoZoo-Data和MoZooBench进行评估,提升了毛发和肌肉动态模拟的效率与质量。
Comments Github Page:https://dongxialiu15.github.io/MoZoo/
AnyRecon:基于视频扩散模型的任意视角3D重建
机构 * AnyRecon: Arbitrary-View 3D Reconstruction with Video Diffusion Model(AnyRecon:任意视角3D重建与视频扩散模型)
专题命中 视频扩散模型 :video diffusion(title);分类 cs.CV
AI总结 AnyRecon通过视频扩散模型实现任意视角3D重建,保留显式几何控制并支持灵活条件设置,通过全局场景记忆和几何感知条件策略提升大场景重建效率与鲁棒性。
Comments Webpage: https://yutian10.github.io/AnyRecon/
视频扩散模型的潜在压缩变分自编码器
机构 * Aalto University(阿alto大学) ; ELLIS Institute Finland(ELLIS研究所芬兰) ; University of Oulu(奥卢大学)
专题命中 视频扩散模型 :video diffusion(title);分类 cs.CV
AI总结 本文提出一种潜在压缩方法,通过去除视频潜在表示中的高频成分而非直接减少通道数,提升视频生成质量与压缩效率。
Comments Accepted to CVPR 2026 findings
STRIDE:当语音识别与序列去噪相结合用于流媒体视频理解
机构 * UIUC(伊利诺伊大学厄巴纳-香槟分校) ; KAIST(韩国科学技术院) ; Google DeepMind(谷歌DeepMind)
专题命中 视频扩散模型 :video understanding(title);分类 cs.CV
AI总结 本文提出STRIDE方法,通过结构化序列建模解决流媒体视频中的主动激活问题,提升在线流媒体场景下的'何时说话'决策质量。
Comments Project page: https://interlive-team.github.io/STRIDE
GO-Renderer: 基于3D感知的可控视频扩散模型生成物体渲染
机构 * HKUST(香港科技大学) ; VAST(中国航空无线电电子研究所) ; Nanyang Technological University(南洋理工大学) ; Tsinghua University(清华大学) ; ShanghaiTech University(上海交通大学)
专题命中 视频扩散模型 :video diffusion(title);分类 cs.CV
AI总结 本文提出GO-Renderer框架,结合重建的3D模型引导视频生成模型,实现高质物体在任意视角和光照下的渲染,无需显式建模复杂材质和光照。
Comments Project page: https://igl-hkust.github.io/GO-Renderer
6Bit-Diffusion:视频扩散模型推理时的混合精度量化
机构 * Fudan University(复旦大学) ; Tsinghua University(清华大学) ; Shanghai Jiao Tong University(上海交通大学)
专题命中 视频扩散模型 :video diffusion(title);分类 cs.CV
AI总结 本文提出了一种推理时的混合精度量化框架,通过动态分配NVFP4和INT8精度,提升视频扩散模型的效率与质量,实验显示在推理速度和内存占用上有显著提升。
ConfCtrl: 通过置信度感知插值实现视频扩散中的精确相机控制
机构 * University of Freiburg(弗赖堡大学) ; Ludwig Maximilian University of Munich(慕尼黑路德维希-马克西米利安大学) ; Technical University of Munich(慕尼黑技术大学) ; Huawei Heisenberg Research Center (Munich)(华为海森堡研究中心(慕尼黑))
专题命中 视频扩散模型 :video diffusion(title);分类 cs.CV
AI总结 ConfCtrl通过置信度感知插值实现视频扩散中的精确相机控制,解决大视角变化下新视角生成问题,提升几何一致性与视觉合理性。
Comments 13 pages
RAP: 基于音频的实时人物动画与视频扩散变换器
专题命中 视频扩散模型 :video diffusion(title);分类 cs.CV
AI总结 RAP通过混合注意力机制和静态-动态训练-推理范式,在实时约束下实现高质量音频驱动人物动画,提升音频-视觉同步与视觉保真度。
Comments 11 pages, 9 figures
FSVideo: 一种在高度压缩潜在空间中的快速速度视频扩散模型
机构 * FSVideo Team Intelligent Creation(FSVideo团队智能创作)
专题命中 视频扩散模型 :video diffusion(title);分类 cs.CV
AI总结 FSVideo通过高度压缩的潜在空间和改进的扩散Transformer架构,在速度和质量上实现了高效视频生成。
Comments Project Page: https://kingofprank.github.io/fsvideo/
PLACID:通过视频扩散与合成轨迹实现身份保持的多物体合成
机构 * Amazon Barcelona(亚马逊巴塞罗那)
专题命中 视频扩散模型 :video diffusion(title);分类 cs.CV
AI总结 PLACID通过视频扩散与合成轨迹实现多物体合成,保持物体身份和背景细节,提升合成效果与视觉吸引力。
VidLaDA:双向扩散大型语言模型用于高效视频理解
机构 * Shanghai Jiao Tong University(上海交通大学) ; Shanghai Innovation Institute(上海创新研究院) ; Fudan University(复旦大学) ; ZhongguanCun Academy(中关村学院) ; Shenzhen International Graduate School, Tsinghua University(清华大学深圳国际研究生院)
专题命中 视频扩散模型 :video understanding(title);分类 cs.CV
AI总结 VidLaDA通过双向注意力和MARS-Cache技术,提升视频理解效率,实现比现有方法更优的性能与速度
DC-VSR: 基于视频扩散先验的时空一致视频超分辨率
机构 * POSTECH ; Visual Display Business, Samsung Electronics(视觉显示业务,三星电子)
专题命中 视频扩散模型 :video diffusion(title);分类 eess.IV
AI总结 DC-VSR通过引入空间和时间注意力传播机制及细节抑制自注意力引导,实现了视频超分辨率的时空一致性与高质量纹理恢复。
Comments Equal contributions from first two authors
Journal ref In Proceedings of the Special Interest Group on Computer Graphics and Interactive Techniques Conference Conference Papers (SIGGRAPH Conference Papers 2025)
焦点引导:从语义弱层中解锁视频扩散模型的可控性
机构 * MoE Key Lab of BIPC, USTC(BIPC联合实验室,中国科学技术大学) ; Shanghai Innovation Institute(上海创新研究院) ; ByteDance China(字节跳动中国)
专题命中 视频扩散模型 :video diffusion(title);分类 cs.CV
AI总结 本文提出Focal Guidance方法,通过细粒度语义引导和注意力缓存增强视频扩散模型中语义弱层的可控性,提升对文本提示的遵循能力。
WorldWarp: 通过异步视频扩散传播3D几何
机构 * National University of Singapore(新加坡国立大学) ; The Hong Kong Polytechnic University(香港理工大学)
专题命中 视频扩散模型 :video diffusion(title);分类 cs.CV
AI总结 WorldWarp通过结合3D结构锚和2D生成细化器,利用时空扩散模型实现几何一致的视频生成,解决遮挡和复杂轨迹问题。
Comments Project page: https://hyokong.github.io/worldwarp-page/
多主体视频动作迁移:通过视频扩散变换器实现
专题命中 视频扩散模型 :video diffusion(title);分类 cs.CV
AI总结 MultiMotion通过视频扩散变换器实现多主体视频动作迁移,引入AMF和RectPC提升动作解纠缠与生成效率,构建首个专用基准数据集。
机构 * Stability AI ; University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校)
专题命中 视频扩散模型 :video generation(title);分类 cs.CV
Comments Page: https://stablepartdiffusion4d.github.io/
专题命中 视频扩散模型 :video diffusion(title);分类 cs.CV
机构 * Ludwig-Maximilians-Universität München (LMU Munich)(慕尼黑路德维希-马克西米利安大学) ; Huawei Heisenberg Research Center(华为海森堡研究中心) ; Technische Universität München (TUM)(慕尼黑技术大学) ; Albert-Ludwigs-Universität Freiburg(弗赖堡阿尔伯特-路易斯-大学)
专题命中 视频扩散模型 :video diffusion(title);分类 cs.CV