arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

视频大模型

视频理解、视频生成、视频语言模型和时序视觉推理。

共收录 6790 信号源:cs.CV, eess.IV, cs.MM

1. 视频扩散模型 1306 篇

2510.09212 2025-10-13 cs.CV 74%

Stable Video Infinity: Infinite-Length Video Generation with Error Recycling

Wuyang Li, Wentao Pan, Po-Chien Luan, Yang Gao, Alexandre Alahi

机构 * EPFL(苏黎世联邦理工学院)

专题命中 视频扩散模型 :video generation(title);分类 cs.CV

Comments Project Page: https://stable-video-infinity.github.io/homepage/

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.19690 2025-09-25 cs.CV 74%

From Prompt to Progression: Taming Video Diffusion Models for Seamless Attribute Transition

Ling Lo, Kelvin C. K. Chan, Wen-Huang Cheng, Ming-Hsuan Yang

机构 * National Yang Ming Chiao Tung University(阳明交通大学) Google DeepMind(谷歌DeepMind) National Taiwan University(国立台湾大学) UC Merced(加州大学梅尔塞德斯分校)

专题命中 视频扩散模型 :video diffusion(title);分类 cs.CV

Comments ICCV 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.10568 2025-08-28 cs.CV cs.AI 74%

DreamActor-H1: High-Fidelity Human-Product Demonstration Video Generation via Motion-designed Diffusion Transformers

Lizhen Wang, Zhurong Xia, Tianshu Hu, Pengrui Wang, Pengfei Wei, Zerong Zheng, Ming Zhou, Yuan Zhang, Mingyuan Gao

机构 * ByteDance Intelligent Creation(字节跳动智能创作)

专题命中 视频扩散模型 :video generation(title);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.04147 2025-08-07 cs.CV 74%

IDCNet: Guided Video Diffusion for Metric-Consistent RGBD Scene Generation with Precise Camera Control

Lijuan Liu, Wenfa Li, Dongbo Zhang, Shuo Wang, Shaohui Jiao

专题命中 视频扩散模型 :video diffusion(title);分类 cs.CV

Comments 10 pages, 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.11706 2025-05-27 cs.CV 74%

AsymRnR: Video Diffusion Transformers Acceleration with Asymmetric Reduction and Restoration

Wenhao Sun, Rong-Cheng Tu, Jingyi Liao, Zhao Jin, Dacheng Tao

专题命中 视频扩散模型 :video diffusion(title);分类 cs.CV

Comments 18 pages, 14 figures. Accepted by ICML 2025. The code is available at https://github.com/wenhao728/AsymRnR

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.09858 2025-05-16 cs.CV 74%

Mission Balance: Generating Under-represented Class Samples using Video Diffusion Models

Danush Kumar Venkatesh, Isabel Funke, Micha Pfeiffer, Fiona Kolbinger, Hanna Maria Schmeiser, Juergen Weitz, Marius Distler, Stefanie Speidel

机构 * NCT/UCC Dresden(德累斯顿NCT/UCC) DKFZ Heidelberg(海德堡DKFZ) Faculty of Medicine & University Hospital Carl Gustav Carus TU Dresden(德累斯顿技术大学医学学院及卡尔·古斯塔夫·卡尔医院) HZDR Dresden, Germany(德累斯顿HZDR) Department of Translational Surgical Oncology, NCT/UCC Dresden, Faculty of Medicine & University Hospital Carl Gustav Carus Germany(德累斯顿NCT/UCC医学系及卡尔·古斯塔夫·卡尔医院) The Centre for Tactile Internet with Human-in-the-Loop (CeTI), TUD Dresden, Germany(德累斯顿TUD tactile internet中心) Weldon School of Biomedical Engineering, Regenstrief Center for Healthcare Engineering (RCHE), Purdue University, USA(美国普渡大学生物医学工程学院及Regenstrief医疗工程中心) Department of Biostatistics and Health Data Science, Richard M. Fairbanks School of Public Health, Indiana University, USA(美国印第安纳大学公共健康学院生物统计学与健康数据科学系) Department of Visceral, Thoracic and Vascular Surgery, University Hospital & Faculty of Medicine Carl Gustav Carus, TUD Germany(德累斯顿技术大学 visceral、胸腔及血管外科系及卡尔·古斯塔夫·卡尔医院)

专题命中 视频扩散模型 :video diffusion(title);分类 cs.CV

Comments Early accept at MICCAI 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.19165 2025-04-30 cs.CV 74%

IM-Portrait: Learning 3D-aware Video Diffusion for Photorealistic Talking Heads from Monocular Videos

Yuan Li, Ziqian Bai, Feitong Tan, Zhaopeng Cui, Sean Fanello, Yinda Zhang

机构 * State Key Lab of CAD&CG, Zhejiang University(浙江大学计算机辅助设计与图形学国家重点实验室)

专题命中 视频扩散模型 :video diffusion(title);分类 cs.CV

Comments CVPR2025; project page: https://y-u-a-n-l-i.github.io/projects/IM-Portrait/

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.15996 2025-03-21 cs.GR cs.CV 74%

Animating the Uncaptured: Humanoid Mesh Animation with Video Diffusion Models

Marc Benedí San Millán, Angela Dai, Matthias Nießner

专题命中 视频扩散模型 :video diffusion(title);分类 cs.CV

Comments 16 pages, 10 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.10634 2025-03-18 cs.CV 74%

V2Edit: Versatile Video Diffusion Editor for Videos and 3D Scenes

Yanming Zhang, Jun-Kun Chen, Jipeng Lyu, Yu-Xiong Wang

专题命中 视频扩散模型 :video diffusion(title);分类 cs.CV

Comments Project Website: https://immortalco.github.io/V2Edit/

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.00733 2025-03-14 cs.CV cs.GR cs.LG 74%

Hallo3: Highly Dynamic and Realistic Portrait Image Animation with Video Diffusion Transformer

Jiahao Cui, Hui Li, Yun Zhan, Hanlin Shang, Kaihui Cheng, Yuqi Ma, Shan Mu, Hang Zhou, Jingdong Wang, Siyu Zhu

专题命中 视频扩散模型 :video diffusion(title);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.15191 2025-03-12 cs.CV cs.LG cs.SD eess.AS 74%

AV-Link: Temporally-Aligned Diffusion Features for Cross-Modal Audio-Video Generation

Moayed Haji-Ali, Willi Menapace, Aliaksandr Siarohin, Ivan Skorokhodov, Alper Canberk, Kwot Sin Lee, Vicente Ordonez, Sergey Tulyakov

专题命中 视频扩散模型 :video generation(title);分类 cs.CV

Comments Project Page: snap-research.github.io/AVLink/

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.14531 2024-12-20 cs.CV 74%

Consistent Human Image and Video Generation with Spatially Conditioned Diffusion

Mingdeng Cao, Chong Mou, Ziyang Yuan, Xintao Wang, Zhaoyang Zhang, Ying Shan, Yinqiang Zheng

专题命中 视频扩散模型 :video generation(title);分类 cs.CV

Comments Project page: https://github.com/ljzycmd/SCD

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.16726 2024-12-17 cs.CV cs.AI 74%

EmotiveTalk: Expressive Talking Head Generation through Audio Information Decoupling and Emotional Video Diffusion

Haotian Wang, Yuzhe Weng, Yueyan Li, Zilu Guo, Jun Du, Shutong Niu, Jiefeng Ma, Shan He, Xiaoyan Wu, Qiming Hu, Bing Yin, Cong Liu, Qingfeng Liu

专题命中 视频扩散模型 :video diffusion(title);分类 cs.CV

Comments https://emotivetalk.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.04462 2024-12-06 cs.CV 74%

4Real-Video: Learning Generalizable Photo-Realistic 4D Video Diffusion

Chaoyang Wang, Peiye Zhuang, Tuan Duc Ngo, Willi Menapace, Aliaksandr Siarohin, Michael Vasilkovsky, Ivan Skorokhodov, Sergey Tulyakov, Peter Wonka, Hsin-Ying Lee

专题命中 视频扩散模型 :video diffusion(title);分类 cs.CV

Comments Project page: https://snap-research.github.io/4Real-Video/

详情

展开后加载摘要…

URL PDF HTML 收藏
2405.17405 2024-09-25 cs.CV 74%

Human4DiT: 360-degree Human Video Generation with 4D Diffusion Transformer

Ruizhi Shao, Youxin Pang, Zerong Zheng, Jingxiang Sun, Yebin Liu

专题命中 视频扩散模型 :video generation(title);分类 cs.CV

Comments Our project website is https://human4dit.github.io

详情

展开后加载摘要…

URL PDF HTML 收藏
2407.10285 2024-07-16 cs.CV 74%

Noise Calibration: Plug-and-play Content-Preserving Video Enhancement using Pre-trained Video Diffusion Models

Qinyu Yang, Haoxin Chen, Yong Zhang, Menghan Xia, Xiaodong Cun, Zhixun Su, Ying Shan

专题命中 视频扩散模型 :video diffusion(title);分类 cs.CV

Comments ECCV 2024, Project Page: https://yangqy1110.github.io/NC-SDEdit/, Code Repo: https://github.com/yangqy1110/NC-SDEdit/

详情

展开后加载摘要…

URL PDF HTML 收藏
2307.16371 2023-08-01 cs.CV 74%

MobileVidFactory: Automatic Diffusion-Based Social Media Video Generation for Mobile Devices from Text

Junchen Zhu, Huan Yang, Wenjing Wang, Huiguo He, Zixi Tuo, Yongsheng Yu, Wen-Huang Cheng, Lianli Gao, Jingkuan Song, Jianlong Fu, Jiebo Luo

专题命中 视频扩散模型 :video generation(title);分类 cs.CV

Comments Accepted by ACM-MM 2023 demo

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.00874 2026-07-28 cs.CV cs.AI cs.LG cs.MM 73%

Latent Space Probing for Adult Content Detection in Video Generative Models

潜在空间探测用于视频生成模型中的成人内容检测

Alizishaan Khatri, Chiquita Prabhu

机构 * Wrynx Inc.(Wrynx公司) Independent Researcher(独立研究者)

专题命中 视频扩散模型 :video generation(abstract);video diffusion(abstract);分类 cs.CV、cs.MM

AI总结 本文提出一种潜在空间探测框架,通过拦截视频扩散模型生成过程中的去噪潜在表示,利用轻量级分类器实现实时成人内容检测,实验表明潜在空间信号在有害内容检测中具有强判别能力。

Comments To be published in 2026 56th Annual IEEE International Conference on Dependable Systems and Networks Workshops (DSN-W)

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.03355 2026-07-03 cs.CV cs.LG eess.IV 73%

Rethinking Video Super-Resolution: Towards Diffusion-Based Methods without Motion Alignment

重新思考视频超分辨率:基于扩散的方法无需运动对齐

Zhihao Zhan, Wang Pang, Xiang Zhu, Yechao Bai

机构 * TopXGun Robotics(TopXGun机器人研究所) Nanjing University(南京大学)

专题命中 视频扩散模型 :video generation(abstract);video diffusion(abstract);分类 cs.CV、eess.IV

AI总结 本文提出基于扩散后验采样框架的视频超分辨率方法,无需显式估计光流或运动参数,通过学习现实物理规律来处理多种运动模式,实验证明其有效性。

Comments ICSPS 2025

Journal ref 17th International Conference on Signal Processing Systems (ICSPS), 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.05442 2025-08-05 cs.CV cs.AI eess.IV 73%

Progressive Growing of Video Tokenizers for Temporally Compact Latent Spaces

Aniruddha Mahapatra, Long Mai, David Bourgin, Yitian Zhang, Feng Liu

机构 * Adobe Research(Adobe研究院) Northeastern University(东北大学)

专题命中 视频扩散模型 :video generation(abstract);video diffusion(abstract);分类 cs.CV、eess.IV

Comments Project website: https://progressive-video-tokenizer.github.io/Pro-MAG/

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.10002 2025-06-13 cs.MM cs.AI cs.CV cs.RO 73%

EQ-TAA: Equivariant Traffic Accident Anticipation via Diffusion-Based Accident Video Synthesis

Jianwu Fang, Lei-Lei Li, Zhedong Zheng, Hongkai Yu, Jianru Xue, Zhengguo Li, Tat-Seng Chua

机构 * Xi’an Jiaotong University(西安交通大学) University of Macau(澳门大学) National University of Singapore(新加坡国立大学) Department of Electrical Engineering and Computer Science, Cleveland State University(克莱姆森大学电气工程与计算机科学系) Institute for Infocomm Research, Agency for Science, Technology and Research (A ∗ STAR)(信息与通信研究机构,科技研究局)

专题命中 视频扩散模型 :video generation(abstract);video diffusion(abstract);分类 cs.CV、cs.MM

Comments Accepted by IEEE-TMM

详情

展开后加载摘要…

URL PDF HTML 收藏
2311.18837 2023-12-01 cs.CV cs.AI cs.LG cs.MM 73%

VIDiff: Translating Videos via Multi-Modal Instructions with Diffusion Models

Zhen Xing, Qi Dai, Zihao Zhang, Hui Zhang, Han Hu, Zuxuan Wu, Yu-Gang Jiang

专题命中 视频扩散模型 :video generation(abstract);long video(abstract);分类 cs.CV、cs.MM

详情

展开后加载摘要…

URL PDF HTML 收藏
2310.07131 2023-10-12 eess.IV cs.CV 73%

Echocardiography video synthesis from end diastolic semantic map via diffusion model

Phi Nguyen Van, Duc Tran Minh, Hieu Pham Huy, Long Tran Quoc

专题命中 视频扩散模型 :video generation(abstract);video diffusion(abstract);分类 cs.CV、eess.IV

详情

展开后加载摘要…

URL PDF HTML 收藏
2305.05464 2023-05-10 cs.CV cs.MM 73%

Style-A-Video: Agile Diffusion for Arbitrary Text-based Video Style Transfer

Nisha Huang, Yuxin Zhang, Weiming Dong

专题命中 视频扩散模型 :video diffusion(abstract);text-to-video(abstract);分类 cs.CV、cs.MM

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.08558 2026-08-11 cs.RO 新提交 71%

Vid2WAM: Distilling Video Diffusion Priors into World Action Models

Vid2WAM:将视频扩散先验蒸馏为世界动作模型

Chenhao Qiu, Ruixiang Wang, Runyi Zhao, Sixu Lin, Songen Gu, Shufeng Nan, Guiliang Liu, Kui Jia, Yanwei Fu, Simo Wu

专题命中 视频扩散模型 :video diffusion(title)

AI总结 Vid2WAM是将视频扩散先验蒸馏为WAM的离线框架,通过双监督通道与源感知残差动作适配,提升了机器人策略的新任务泛化性与数据效率,且推理高效。

Comments Project website: https://qch-fa.github.io/vid2wam-website/

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.17631 2025-08-28 cs.LG cs.AI 71%

ControlEchoSynth: Boosting Ejection Fraction Estimation Models via Controlled Video Diffusion

Nima Kondori, Hanwen Liang, Hooman Vaseli, Bingyu Xie, Christina Luong, Purang Abolmaesumi, Teresa Tsang, Renjie Liao

机构 * The University of British Columbia(不列颠哥伦比亚大学) University of Toronto(多伦多大学) Vancouver General Hospital, Vancouver, BC, Canada(温哥华总医院)

专题命中 视频扩散模型 :video diffusion(title)

Comments Data Curation and Augmentation in Medical Imaging CVPR 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.04546 2026-08-20 cs.RO cs.AI cs.CV cs.LG 版本更新 70%

Mask2Real-WM: Segmentation Masks as a Sim-to-Real Bridge for Controllable Dexterous World Models

Mask2Real-WM:作为可控灵巧世界模型的模拟到现实桥梁的分割掩码

Riccardo O. Feingold, Davide Liconti, Chenyu Yang, Robert K. Katzschmann

机构 * Soft Robotic Lab, Department of Mechanical and Process Engineering ETH Zurich, Switzerland(苏黎世联邦理工学院机械与过程工程系软机器人实验室)

专题命中 视频扩散模型 :video diffusion(abstract,abstract_cn);分类 cs.CV

AI总结 提出Mask2Real-WM,一种用于灵巧操纵的两阶段动作条件世界模型,将像素预测解耦为动力学和渲染模型,利用分割空间较小的模拟到现实差距,通过合成数据预训练和真实演示微调实现各自由度动作可控。

Comments 23 pages, 24 figures, 4 tables. Preprint. Project page: https://srl-ethz.github.io/Mask2Real-WM/

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.13357 2026-08-06 cs.CV cs.AI 版本更新 70%

AdaCorrection: Adaptive Offset Cache Correction for Accurate Diffusion Transformers

AdaCorrection: 用于准确扩散变换器的自适应偏移缓存校正

Dong Liu, Yanxuan Yu, Ben Lengerich, Ying Nian Wu

机构 * Columbia University(哥伦比亚大学)

专题命中 视频扩散模型 :video generation(abstract);video diffusion(abstract);分类 cs.CV

AI总结 本文提出AdaCorrection框架,通过自适应偏移缓存校正提升扩散变换器的生成质量与缓存复用效率,减少计算开销并保持高保真度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.01127 2026-08-05 cs.CV 版本更新 70%

MiniWorld: Democratizing the Training of Video World Models from Scratch

MiniWorld:从零开始普及视频世界模型的训练

Yian Zhao, Ruochong Zheng, Hongcan Guo, Yu Yan, Jian Zhang, Jie Chen

机构 * Peking University(北京大学)

专题命中 视频扩散模型 :video generation(abstract);video diffusion(abstract);分类 cs.CV

AI总结 MiniWorld是从零开始训练流式视频世界模型的可复现框架,采用特定模型与训练策略,可在单台8-GPU服务器数天内完成训练,旨在降低训练门槛以推动相关研究。

Comments 19 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.22718 2026-07-31 cs.CV 版本更新 70%

Generative Relightable Avatars

生成式可重光照虚拟化身

Kunwar Maheep Singh, Christian Theobalt, Rishabh Dabral

机构 * Max Planck Institute for Informatics, Saarland Informatics Campus(马克斯·普朗克信息学研究所,萨尔兰信息学园区)

专题命中 视频扩散模型 :video diffusion(abstract);long video(abstract);分类 cs.CV

AI总结 提出生成式可重光照虚拟化身(GRA),结合物理光照与概率细化,实现全身人物的自由视角渲染和环境图重光照,在感知质量上优于现有方法。

Comments Project Page: https://vcai.mpi-inf.mpg.de/projects/GRA/

详情

展开后加载摘要…

URL PDF HTML 收藏