arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

视频大模型

视频理解、视频生成、视频语言模型和时序视觉推理。

共收录 6808 信号源:cs.CV, eess.IV, cs.MM

1. 视频扩散模型 1308 篇

2512.12080 2025-12-16 cs.CV cs.LG 79%

BAgger: Backwards Aggregation for Mitigating Drift in Autoregressive Video Diffusion Models

BAgger: 逆向聚合用于缓解自回归视频扩散模型中的漂移

Ryan Po, Eric Ryan Chan, Changan Chen, Gordon Wetzstein

机构 * Stanford University(斯坦福大学)

专题命中 视频扩散模型 :video diffusion(title);text-to-video(abstract);分类 cs.CV

AI总结 BAgger通过自监督方法缓解自回归视频扩散模型中的漂移问题,利用标准分数或流匹配目标提升长期运动稳定性与视觉一致性。

Comments Project page here: https://ryanpo.com/bagger

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.02339 2025-12-03 cs.CV cs.AI 79%

Video Diffusion Models Excel at Tracking Similar-Looking Objects Without Supervision

视频扩散模型在无监督情况下能有效追踪相似外观的对象

Chenshuang Zhang, Kang Zhang, Joon Son Chung, In So Kweon, Junmo Kim, Chengzhi Mao

机构 * KAIST(韩国科学技术院) Rutgers University(罗格斯大学)

专题命中 视频扩散模型 :video diffusion(title,abstract);分类 cs.CV

AI总结 本文提出利用预训练视频扩散模型的运动表示能力,实现无监督环境下对视觉相似对象的高效追踪,提升了追踪性能并克服了现有方法的局限。

Comments Accepted at NeurIPS 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.23127 2025-12-02 cs.CV 79%

DualCamCtrl: Dual-Branch Diffusion Model for Geometry-Aware Camera-Controlled Video Generation

DualCamCtrl: 基于双分支扩散模型的几何感知摄像机控制视频生成

Hongfei Zhang, Kanghao Chen, Zixin Zhang, Harold Haodong Chen, Yuanhuiyi Lyu, Yuqi Zhang, Shuai Yang, Kun Zhou, Yingcong Chen

机构 * HKUST (GZ)(香港科技大学) HKUST(香港科技大学) Fudan University(复旦大学) Shenzhen University(深圳大学)

专题命中 视频扩散模型 :video generation(title,abstract);分类 cs.CV

AI总结 DualCamCtrl通过双分支扩散模型实现几何感知的摄像机控制视频生成,有效提升视频生成的一致性和准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.19229 2025-12-01 cs.CV cs.AI 79%

Learning Plug-and-play Memory for Guiding Video Diffusion Models

学习插件式记忆以指导视频扩散模型

Selena Song, Ziming Xu, Zijun Zhang, Kun Zhou, Jiaxian Guo, Lianhui Qin, Biwei Huang

机构 * University of California, San Diego(加州大学圣地亚哥分校) The University of Tokyo(东京大学)

专题命中 视频扩散模型 :video diffusion(title);video generation(abstract);分类 cs.CV

AI总结 本文提出DiT-Mem,通过学习插件式记忆增强视频扩散模型的物理规则遵循和视频保真度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.17481 2025-11-24 cs.CV 79%

Counterfactual World Models via Digital Twin-conditioned Video Diffusion

通过数字孪生条件的视频扩散实现反事实世界模型

Yiqing Shen, Aiza Maksutova, Chenjia Li, Mathias Unberath

机构 * Johns Hopkins University(约翰霍普金斯大学)

专题命中 视频扩散模型 :video diffusion(title,abstract);分类 cs.CV

AI总结 CWMDT通过构建数字孪生和应用大语言模型,实现反事实世界模型,提升对视频正向模拟的控制能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.01406 2025-11-21 cs.CV cs.CR cs.LG 79%

VIDSTAMP: A Temporally-Aware Watermark for Ownership and Integrity in Video Diffusion Models

VIDSTAMP:一种时间感知的水印用于视频扩散模型中的所有权和完整性

Mohammadreza Teymoorianfard, Siddarth Sitaraman, Shiqing Ma, Amir Houmansadr

机构 * University of Massachusetts Amherst(马萨诸塞大学阿默斯特分校) Brown University(布朗大学)

专题命中 视频扩散模型 :video diffusion(title,abstract);分类 cs.CV

AI总结 VidStamp通过帧级信息嵌入和动态控制信号实现高容量、低感知影响的视频水印,提升视频扩散模型的版权和完整性保障能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.12072 2025-11-18 cs.MM cs.AI cs.SD 79%

ProAV-DiT: A Projected Latent Diffusion Transformer for Efficient Synchronized Audio-Video Generation

Jiahui Sun, Weining Wang, Mingzhen Sun, Yirong Yang, Xinxin Zhu, Jing Liu

机构 * Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所) Beihang University(北航大学)

专题命中 视频扩散模型 :video generation(title,abstract);分类 cs.MM

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.12056 2025-11-18 cs.CV cs.AI cs.DC 79%

PipeDiT: Accelerating Diffusion Transformers in Video Generation with Task Pipelining and Model Decoupling

Sijie Wang, Qiang Wang, Shaohuai Shi

机构 * Sijie Wang, Qiang Wang, Shaohuai Shi(作者)

专题命中 视频扩散模型 :video generation(title,abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.11343 2025-11-14 cs.CV stat.AP 79%

Latent Knowledge-Guided Video Diffusion for Scientific Phenomena Generation from a Single Initial Frame

Qinglong Cao, Xirui Li, Ding Wang, Chao Ma, Yuntian Chen, Xiaokang Yang

机构 * Eitech(艾tech)

专题命中 视频扩散模型 :video diffusion(title,abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.13389 2025-10-29 cs.CV 79%

VSA: Faster Video Diffusion with Trainable Sparse Attention

Peiyuan Zhang, Yongqi Chen, Haofeng Huang, Will Lin, Zhengzhong Liu, Ion Stoica, Eric Xing, Hao Zhang

机构 * UC San Diego(UC圣迭戈大学) MBZUAI(穆桑大学人工智能研究所) UC Berkeley(伯克利大学)

专题命中 视频扩散模型 :video diffusion(title,abstract);分类 cs.CV

Comments Accepted by Neurips 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.18033 2025-10-17 cs.CV 79%

OmnimatteZero: Fast Training-free Omnimatte with Pre-trained Video Diffusion Models

Dvir Samuel, Matan Levy, Nir Darshan, Gal Chechik, Rami Ben-Ari

机构 * Bar-Ilan University \& OriginAI Israel The Hebrew University of Jerusalem Israel Bar-Ilan University \& NVIDIA Research Israel Bar-Ilan University \& OriginAI The Hebrew University of Jerusalem Bar-Ilan University \& NVIDIA Research

专题命中 视频扩散模型 :video diffusion(title,abstract);分类 cs.CV

Comments Accepted to SIGGRAPH ASIA 2025. Project Page: https://dvirsamuel.github.io/omnimattezero.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.21593 2025-10-13 cs.CV cs.AI 79%

Any-to-Bokeh: Arbitrary-Subject Video Refocusing with Video Diffusion Model

Yang Yang, Siming Zheng, Qirui Yang, Jinwei Chen, Boxi Wu, Xiaofei He, Deng Cai, Bo Li, Peng-Tao Jiang

机构 * Zhejiang University(浙江大学) vivo Mobile Communication Co., Ltd(vivo移动通信有限公司)

专题命中 视频扩散模型 :video diffusion(title,abstract);分类 cs.CV

Comments project page: https://vivocameraresearch.github.io/any2bokeh/

详情

展开后加载摘要…

URL PDF HTML 收藏
2409.02851 2025-10-13 cs.CV cs.GR 79%

Human-VDM: Learning Single-Image 3D Human Gaussian Splatting from Video Diffusion Models

Zhibin Liu, Haoye Dong, Aviral Chharia, Hefeng Wu

专题命中 视频扩散模型 :video diffusion(title,abstract);分类 cs.CV

Comments 14 Pages, 8 figures, Project page: https://human-vdm.github.io/Human-VDM/

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.13934 2025-10-07 cs.CV 79%

DiViD: Disentangled Video Diffusion for Static-Dynamic Factorization

Marzieh Gheisari, Auguste Genovesio

机构 * École Normale Supérieure PSL(巴黎高等师范学院)

专题命中 视频扩散模型 :video diffusion(title,abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.01669 2025-10-06 cs.CV 79%

UniVerse: Unleashing the Scene Prior of Video Diffusion Models for Robust Radiance Field Reconstruction

Jin Cao, Hongrui Wu, Ziyong Feng, Hujun Bao, Xiaowei Zhou, Sida Peng

机构 * State Key Lab of CAD&CG, Zhejiang University(CAD与CG国家重点实验室,浙江大学) Tongji University(同济大学) DeepGlint

专题命中 视频扩散模型 :video diffusion(title,abstract);分类 cs.CV

Comments page: https://jin-cao-tma.github.io/UniVerse.github.io/ code: https://github.com/zju3dv/UniVerse

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.23769 2025-10-02 cs.GR cs.AI cs.CV 79%

ReLumix: Extending Image Relighting to Video via Video Diffusion Models

Lezhong Wang, Shutong Jin, Ruiqi Cui, Anders Bjorholm Dahl, Jeppe Revall Frisvad, Siavash Bigdeli

机构 * Technical University of Denmark(丹麦技术大学) KTH Royal Institute of Technology(皇家理工学院)

专题命中 视频扩散模型 :video diffusion(title,abstract);分类 cs.CV

Comments Project page: https://lez-s.github.io/Relumix_project/

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.19296 2025-09-24 cs.CV cs.GR 79%

Lyra: Generative 3D Scene Reconstruction via Video Diffusion Model Self-Distillation

Sherwin Bahmani, Tianchang Shen, Jiawei Ren, Jiahui Huang, Yifeng Jiang, Haithem Turki, Andrea Tagliasacchi, David B. Lindell, Zan Gojcic, Sanja Fidler, Huan Ling, Jun Gao, Xuanchi Ren

机构 * NVIDIA University of Toronto(多伦多大学) Vector Institute(向量研究所) Simon Fraser University(西蒙弗雷泽大学)

专题命中 视频扩散模型 :video diffusion(title,abstract);分类 cs.CV

Comments Project Page: https://research.nvidia.com/labs/toronto-ai/lyra/

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.03680 2025-09-05 cs.GR cs.AI cs.CV 79%

LuxDiT: Lighting Estimation with Video Diffusion Transformer

Ruofan Liang, Kai He, Zan Gojcic, Igor Gilitschenski, Sanja Fidler, Nandita Vijaykumar, Zian Wang

机构 * NVIDIA University of Toronto(多伦多大学) Vector Institute(向量研究所)

专题命中 视频扩散模型 :video diffusion(title,abstract);分类 cs.CV

Comments Project page: https://research.nvidia.com/labs/toronto-ai/LuxDiT/

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.00843 2025-09-03 cs.CV cs.AI 79%

Look Beyond: Two-Stage Scene View Generation via Panorama and Video Diffusion

Xueyang Kang, Zhengkang Xiang, Zezheng Zhang, Kourosh Khoshelham

机构 * University of Melbourne(墨尔本大学)

专题命中 视频扩散模型 :video diffusion(title,abstract);分类 cs.CV

Comments 26 pages, 30 figures, 2025 ACM Multimedia

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.13188 2025-08-27 cs.CV 79%

StreetCrafter: Street View Synthesis with Controllable Video Diffusion Models

Yunzhi Yan, Zhen Xu, Haotong Lin, Haian Jin, Haoyu Guo, Yida Wang, Kun Zhan, Xianpeng Lang, Hujun Bao, Xiaowei Zhou, Sida Peng

机构 * Zhejiang University(浙江大学) Li Auto Inc.(Li汽车公司) Cornell University(康奈尔大学)

专题命中 视频扩散模型 :video diffusion(title,abstract);分类 cs.CV

Comments Project page: https://zju3dv.github.io/street_crafter

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.09667 2025-08-14 cs.CV 79%

GSFixer: Improving 3D Gaussian Splatting with Reference-Guided Video Diffusion Priors

Xingyilang Yin, Qi Zhang, Jiahao Chang, Ying Feng, Qingnan Fan, Xi Yang, Chi-Man Pun, Huaqi Zhang, Xiaodong Cun

机构 * University of Macau(澳门大学) VIVO CUHKSZ(香港中文大学) Xidian University(西安电子科技大学) GVC Lab, Great Bay University(大澳大学GVC实验室)

专题命中 视频扩散模型 :video diffusion(title,abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.08978 2025-08-13 cs.CV 79%

TaoCache: Structure-Maintained Video Generation Acceleration

Zhentao Fan, Zongzuo Wang, Weiwei Zhang

机构 * Huawei Inc.(华为公司)

专题命中 视频扩散模型 :video generation(title);video diffusion(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.08333 2025-08-12 cs.CV 79%

DAViD: Modeling Dynamic Affordance of 3D Objects Using Pre-trained Video Diffusion Models

Hyeonwoo Kim, Sangwon Baik, Hanbyul Joo

机构 * Seoul National University(首尔国立大学)

专题命中 视频扩散模型 :video diffusion(title,abstract);分类 cs.CV

Comments Project Page: https://snuvclab.github.io/david/

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.17539 2025-08-12 cs.CV 79%

Generating, Fast and Slow: Scalable Parallel Video Generation with Video Interface Networks

Bhishma Dedhia, David Bourgin, Krishna Kumar Singh, Yuheng Li, Yan Kang, Zhan Xu, Niraj K. Jha, Yuchen Liu

机构 * Princeton University(普林斯顿大学) Adobe Research(Adobe研究)

专题命中 视频扩散模型 :video generation(title);long video(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.06392 2025-08-11 cs.CV 79%

FVGen: Accelerating Novel-View Synthesis with Adversarial Video Diffusion Distillation

Wenbin Teng, Gonglin Chen, Haiwei Chen, Yajie Zhao

专题命中 视频扩散模型 :video diffusion(title,abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.04467 2025-08-07 cs.CV 79%

4DVD: Cascaded Dense-view Video Diffusion Model for High-quality 4D Content Generation

Shuzhou Yang, Xiaodong Cun, Xiaoyu Li, Yaowei Li, Jian Zhang

专题命中 视频扩散模型 :video diffusion(title,abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.03123 2025-08-07 cs.CV 79%

Dual-Expert Consistency Model for Efficient and High-Quality Video Generation

Zhengyao Lv, Chenyang Si, Tianlin Pan, Zhaoxi Chen, Kwan-Yee K. Wong, Yu Qiao, Ziwei Liu

机构 * Nanjing University(南京大学) The University of Hong Kong(香港大学) Shanghai Artificial Intelligence Laboratory(上海人工智能实验室) University of Chinese Academy of Sciences(中国科学院大学) S-Lab, Nanyang Technological University(南洋理工大学S实验室)

专题命中 视频扩散模型 :video generation(title);video diffusion(abstract);分类 cs.CV

Comments This paper has been accepted to ICCV 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.08331 2025-08-07 cs.CV 79%

Go-with-the-Flow: Motion-Controllable Video Diffusion Models Using Real-Time Warped Noise

Ryan Burgert, Yuancheng Xu, Wenqi Xian, Oliver Pilarski, Pascal Clausen, Mingming He, Li Ma, Yitong Deng, Lingxiao Li, Mohsen Mousavi, Michael Ryoo, Paul Debevec, Ning Yu

机构 * Netflix Eyeline Studios(NetflixEyeline Studios) Netflix Stony Brook University(斯通布罗克大学) University of Maryland(马里兰大学) Stanford University(斯坦福大学)

专题命中 视频扩散模型 :video diffusion(title,abstract);分类 cs.CV

Comments Accepted to CVPR'25 as Oral

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.17350 2025-08-06 cs.CV 79%

Decouple and Track: Benchmarking and Improving Video Diffusion Transformers for Motion Transfer

Qingyu Shi, Jianzong Wu, Jinbin Bai, Jiangning Zhang, Lu Qi, Yunhai Tong, Xiangtai Li

机构 * PKU(北京大学) NTU(国立新加坡大学) NUS(新加坡国立大学) ZJU(浙江大学) UC Merced(加州大学默塞德分校)

专题命中 视频扩散模型 :video diffusion(title,abstract);分类 cs.CV

Comments ICCV 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.04847 2025-08-05 cs.CV 79%

HumanDiT: Pose-Guided Diffusion Transformer for Long-form Human Motion Video Generation

Qijun Gan, Yi Ren, Chen Zhang, Zhenhui Ye, Pan Xie, Xiang Yin, Zehuan Yuan, Bingyue Peng, Jianke Zhu

机构 * Zhejiang University(浙江大学) ByteDance(字节跳动)

专题命中 视频扩散模型 :video generation(title,abstract);分类 cs.CV

Comments https://agnjason.github.io/HumanDiT-page/

详情

展开后加载摘要…

URL PDF HTML 收藏