Stable Video Infinity: Infinite-Length Video Generation with Error Recycling
机构 * EPFL(苏黎世联邦理工学院)
专题命中 视频扩散模型 :video generation(title);分类 cs.CV
Comments Project Page: https://stable-video-infinity.github.io/homepage/
AI 大模型
视频理解、视频生成、视频语言模型和时序视觉推理。
机构 * EPFL(苏黎世联邦理工学院)
专题命中 视频扩散模型 :video generation(title);分类 cs.CV
Comments Project Page: https://stable-video-infinity.github.io/homepage/
机构 * National Yang Ming Chiao Tung University(阳明交通大学) ; Google DeepMind(谷歌DeepMind) ; National Taiwan University(国立台湾大学) ; UC Merced(加州大学梅尔塞德斯分校)
专题命中 视频扩散模型 :video diffusion(title);分类 cs.CV
Comments ICCV 2025
机构 * ByteDance Intelligent Creation(字节跳动智能创作)
专题命中 视频扩散模型 :video generation(title);分类 cs.CV
专题命中 视频扩散模型 :video diffusion(title);分类 cs.CV
Comments 10 pages, 7 figures
专题命中 视频扩散模型 :video diffusion(title);分类 cs.CV
Comments 18 pages, 14 figures. Accepted by ICML 2025. The code is available at https://github.com/wenhao728/AsymRnR
机构 * NCT/UCC Dresden(德累斯顿NCT/UCC) ; DKFZ Heidelberg(海德堡DKFZ) ; Faculty of Medicine & University Hospital Carl Gustav Carus TU Dresden(德累斯顿技术大学医学学院及卡尔·古斯塔夫·卡尔医院) ; HZDR Dresden, Germany(德累斯顿HZDR) ; Department of Translational Surgical Oncology, NCT/UCC Dresden, Faculty of Medicine & University Hospital Carl Gustav Carus Germany(德累斯顿NCT/UCC医学系及卡尔·古斯塔夫·卡尔医院) ; The Centre for Tactile Internet with Human-in-the-Loop (CeTI), TUD Dresden, Germany(德累斯顿TUD tactile internet中心) ; Weldon School of Biomedical Engineering, Regenstrief Center for Healthcare Engineering (RCHE), Purdue University, USA(美国普渡大学生物医学工程学院及Regenstrief医疗工程中心) ; Department of Biostatistics and Health Data Science, Richard M. Fairbanks School of Public Health, Indiana University, USA(美国印第安纳大学公共健康学院生物统计学与健康数据科学系) ; Department of Visceral, Thoracic and Vascular Surgery, University Hospital & Faculty of Medicine Carl Gustav Carus, TUD Germany(德累斯顿技术大学 visceral、胸腔及血管外科系及卡尔·古斯塔夫·卡尔医院)
专题命中 视频扩散模型 :video diffusion(title);分类 cs.CV
Comments Early accept at MICCAI 2025
机构 * State Key Lab of CAD&CG, Zhejiang University(浙江大学计算机辅助设计与图形学国家重点实验室)
专题命中 视频扩散模型 :video diffusion(title);分类 cs.CV
Comments CVPR2025; project page: https://y-u-a-n-l-i.github.io/projects/IM-Portrait/
专题命中 视频扩散模型 :video diffusion(title);分类 cs.CV
Comments 16 pages, 10 figures
专题命中 视频扩散模型 :video diffusion(title);分类 cs.CV
Comments Project Website: https://immortalco.github.io/V2Edit/
专题命中 视频扩散模型 :video diffusion(title);分类 cs.CV
专题命中 视频扩散模型 :video generation(title);分类 cs.CV
Comments Project Page: snap-research.github.io/AVLink/
专题命中 视频扩散模型 :video generation(title);分类 cs.CV
Comments Project page: https://github.com/ljzycmd/SCD
专题命中 视频扩散模型 :video diffusion(title);分类 cs.CV
Comments https://emotivetalk.github.io/
专题命中 视频扩散模型 :video diffusion(title);分类 cs.CV
Comments Project page: https://snap-research.github.io/4Real-Video/
专题命中 视频扩散模型 :video generation(title);分类 cs.CV
Comments Our project website is https://human4dit.github.io
专题命中 视频扩散模型 :video diffusion(title);分类 cs.CV
Comments ECCV 2024, Project Page: https://yangqy1110.github.io/NC-SDEdit/, Code Repo: https://github.com/yangqy1110/NC-SDEdit/
专题命中 视频扩散模型 :video generation(title);分类 cs.CV
Comments Accepted by ACM-MM 2023 demo
潜在空间探测用于视频生成模型中的成人内容检测
机构 * Wrynx Inc.(Wrynx公司) ; Independent Researcher(独立研究者)
专题命中 视频扩散模型 :video generation(abstract);video diffusion(abstract);分类 cs.CV、cs.MM
AI总结 本文提出一种潜在空间探测框架,通过拦截视频扩散模型生成过程中的去噪潜在表示,利用轻量级分类器实现实时成人内容检测,实验表明潜在空间信号在有害内容检测中具有强判别能力。
Comments To be published in 2026 56th Annual IEEE International Conference on Dependable Systems and Networks Workshops (DSN-W)
重新思考视频超分辨率:基于扩散的方法无需运动对齐
机构 * TopXGun Robotics(TopXGun机器人研究所) ; Nanjing University(南京大学)
专题命中 视频扩散模型 :video generation(abstract);video diffusion(abstract);分类 cs.CV、eess.IV
AI总结 本文提出基于扩散后验采样框架的视频超分辨率方法,无需显式估计光流或运动参数,通过学习现实物理规律来处理多种运动模式,实验证明其有效性。
Comments ICSPS 2025
Journal ref 17th International Conference on Signal Processing Systems (ICSPS), 2025
机构 * Adobe Research(Adobe研究院) ; Northeastern University(东北大学)
专题命中 视频扩散模型 :video generation(abstract);video diffusion(abstract);分类 cs.CV、eess.IV
Comments Project website: https://progressive-video-tokenizer.github.io/Pro-MAG/
机构 * Xi’an Jiaotong University(西安交通大学) ; University of Macau(澳门大学) ; National University of Singapore(新加坡国立大学) ; Department of Electrical Engineering and Computer Science, Cleveland State University(克莱姆森大学电气工程与计算机科学系) ; Institute for Infocomm Research, Agency for Science, Technology and Research (A ∗ STAR)(信息与通信研究机构,科技研究局)
专题命中 视频扩散模型 :video generation(abstract);video diffusion(abstract);分类 cs.CV、cs.MM
Comments Accepted by IEEE-TMM
专题命中 视频扩散模型 :video generation(abstract);long video(abstract);分类 cs.CV、cs.MM
专题命中 视频扩散模型 :video generation(abstract);video diffusion(abstract);分类 cs.CV、eess.IV
专题命中 视频扩散模型 :video diffusion(abstract);text-to-video(abstract);分类 cs.CV、cs.MM
Vid2WAM:将视频扩散先验蒸馏为世界动作模型
专题命中 视频扩散模型 :video diffusion(title)
AI总结 Vid2WAM是将视频扩散先验蒸馏为WAM的离线框架,通过双监督通道与源感知残差动作适配,提升了机器人策略的新任务泛化性与数据效率,且推理高效。
Comments Project website: https://qch-fa.github.io/vid2wam-website/
机构 * The University of British Columbia(不列颠哥伦比亚大学) ; University of Toronto(多伦多大学) ; Vancouver General Hospital, Vancouver, BC, Canada(温哥华总医院)
专题命中 视频扩散模型 :video diffusion(title)
Comments Data Curation and Augmentation in Medical Imaging CVPR 2024
Mask2Real-WM:作为可控灵巧世界模型的模拟到现实桥梁的分割掩码
机构 * Soft Robotic Lab, Department of Mechanical and Process Engineering ETH Zurich, Switzerland(苏黎世联邦理工学院机械与过程工程系软机器人实验室)
专题命中 视频扩散模型 :video diffusion(abstract,abstract_cn);分类 cs.CV
AI总结 提出Mask2Real-WM,一种用于灵巧操纵的两阶段动作条件世界模型,将像素预测解耦为动力学和渲染模型,利用分割空间较小的模拟到现实差距,通过合成数据预训练和真实演示微调实现各自由度动作可控。
Comments 23 pages, 24 figures, 4 tables. Preprint. Project page: https://srl-ethz.github.io/Mask2Real-WM/
AdaCorrection: 用于准确扩散变换器的自适应偏移缓存校正
机构 * Columbia University(哥伦比亚大学)
专题命中 视频扩散模型 :video generation(abstract);video diffusion(abstract);分类 cs.CV
AI总结 本文提出AdaCorrection框架,通过自适应偏移缓存校正提升扩散变换器的生成质量与缓存复用效率,减少计算开销并保持高保真度。
MiniWorld:从零开始普及视频世界模型的训练
机构 * Peking University(北京大学)
专题命中 视频扩散模型 :video generation(abstract);video diffusion(abstract);分类 cs.CV
AI总结 MiniWorld是从零开始训练流式视频世界模型的可复现框架,采用特定模型与训练策略,可在单台8-GPU服务器数天内完成训练,旨在降低训练门槛以推动相关研究。
Comments 19 pages
生成式可重光照虚拟化身
机构 * Max Planck Institute for Informatics, Saarland Informatics Campus(马克斯·普朗克信息学研究所,萨尔兰信息学园区)
专题命中 视频扩散模型 :video diffusion(abstract);long video(abstract);分类 cs.CV
AI总结 提出生成式可重光照虚拟化身(GRA),结合物理光照与概率细化,实现全身人物的自由视角渲染和环境图重光照,在感知质量上优于现有方法。
Comments Project Page: https://vcai.mpi-inf.mpg.de/projects/GRA/