arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

视频大模型

视频理解、视频生成、视频语言模型和时序视觉推理。

共收录 1306 信号源:cs.CV, eess.IV, cs.MM

1. 视频扩散模型 1306 篇

2506.15673 2025-06-19 cs.CV 57%

UniRelight: Learning Joint Decomposition and Synthesis for Video Relighting

Kai He, Ruofan Liang, Jacob Munkberg, Jon Hasselgren, Nandita Vijaykumar, Alexander Keller, Sanja Fidler, Igor Gilitschenski, Zan Gojcic, Zian Wang

机构 * NVIDIA University of Toronto(多伦多大学) Vector Institute(向量研究所)

专题命中 视频扩散模型 :video diffusion(abstract);分类 cs.CV

Comments Project page: https://research.nvidia.com/labs/toronto-ai/UniRelight/

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.13754 2025-06-18 cs.LG cs.AI cs.CV 57%

VideoPDE: Unified Generative PDE Solving via Video Inpainting Diffusion Models

Edward Li, Zichen Wang, Jiahe Huang, Jeong Joon Park

机构 * University of Michigan(密歇根大学)

专题命中 视频扩散模型 :video diffusion(abstract);分类 cs.CV

Comments Project page: https://videopde.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.08529 2025-06-11 cs.CV 57%

LiftVSR: Lifting Image Diffusion to Video Super-Resolution via Hybrid Temporal Modeling with Only 4$\times$RTX 4090s

Xijun Wang, Xin Li, Bingchen Li, Zhibo Chen

机构 * University of Science and Technology of China(中国科学技术大学)

专题命中 视频扩散模型 :long video(abstract);分类 cs.CV

Comments Project page: https://kopperx.github.io/projects/liftvsr

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.08351 2025-06-11 cs.CV cs.AI cs.CL 57%

How Much To Guide: Revisiting Adaptive Guidance in Classifier-Free Guidance Text-to-Vision Diffusion Models

Huixuan Zhang, Junzhe Zhang, Xiaojun Wan

机构 * Wangxuan Institute of Computer Technology, Peking University(北京大学王玄计算技术研究所)

专题命中 视频扩散模型 :video generation(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.08004 2025-06-10 cs.CV cs.AI 57%

Dynamic View Synthesis as an Inverse Problem

Hidir Yesiltepe, Pinar Yanardag

机构 * Virginia Tech(弗吉尼亚理工大学)

专题命中 视频扩散模型 :video diffusion(abstract);分类 cs.CV

Comments Project Page: https://inverse-dvs.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.14831 2025-06-10 cs.CV cs.AI cs.LG 57%

Improving the Diffusability of Autoencoders

Ivan Skorokhodov, Sharath Girish, Benran Hu, Willi Menapace, Yanyu Li, Rameen Abdal, Sergey Tulyakov, Aliaksandr Siarohin

专题命中 视频扩散模型 :video generation(abstract);分类 cs.CV

Comments ICML 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.06199 2025-06-09 cs.RO cs.CV 57%

3DFlowAction: Learning Cross-Embodiment Manipulation from 3D Flow World Model

Hongyan Zhi, Peihao Chen, Siyuan Zhou, Yubo Dong, Quanxi Wu, Lei Han, Mingkui Tan

机构 * South China University of Technology(南方科技大学) Tencent Robotics X(腾讯机器人实验室) Hong Kong University of Science and Technology(香港科学与技术大学) Pazhou Laboratory(琶洲实验室)

专题命中 视频扩散模型 :video diffusion(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.05934 2025-06-09 cs.CV cs.AI 57%

FADE: Frequency-Aware Diffusion Model Factorization for Video Editing

Yixuan Zhu, Haolin Wang, Shilin Ma, Wenliang Zhao, Yansong Tang, Lei Chen, Jie Zhou

机构 * Department of Automation, Tsinghua University(自动化系,清华大学) Tsinghua Shenzhen International Graduate School, Tsinghua University(清华大学深圳国际研究生院,清华大学)

专题命中 视频扩散模型 :video diffusion(abstract);分类 cs.CV

Comments Accepted by IEEE/CVF Conference on Computer Vision and Pattern Recognition (CVPR) 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.03275 2025-06-05 cs.CV cs.AI 57%

Chipmunk: Training-Free Acceleration of Diffusion Transformers with Dynamic Column-Sparse Deltas

Austin Silveria, Soham V. Govande, Daniel Y. Fu

机构 * University of California, San Diego(加州大学圣地亚哥分校) Together AI Stanford University(斯坦福大学)

专题命中 视频扩散模型 :video generation(abstract);分类 cs.CV

Comments 10 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.01014 2025-06-02 cs.CV 57%

AnimeGamer: Infinite Anime Life Simulation with Next Game State Prediction

Junhao Cheng, Yuying Ge, Yixiao Ge, Jing Liao, Ying Shan

机构 * ARC Lab, Tencent PCG(腾讯PCG ARC实验室) City University of Hong Kong(香港城市大学)

专题命中 视频扩散模型 :video diffusion(abstract);分类 cs.CV

Comments Project released at: https://howe125.github.io/AnimeGamer.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.22167 2025-05-29 cs.CV 57%

Q-VDiT: Towards Accurate Quantization and Distillation of Video-Generation Diffusion Transformers

Weilun Feng, Chuanguang Yang, Haotong Qin, Xiangqi Li, Yu Wang, Zhulin An, Libo Huang, Boyu Diao, Zixiang Zhao, Yongjun Xu, Michele Magno

专题命中 视频扩散模型 :video generation(abstract);分类 cs.CV

Comments Accepted to ICML2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.20422 2025-05-28 cs.CV 57%

Bringing Objects to Life: training-free 4D generation from 3D objects through view consistent noise

Ohad Rahamim, Ori Malca, Dvir Samuel, Gal Chechik

机构 * Bar-Ilan University(巴伊兰大学) NVIDIA(英伟达)

专题命中 视频扩散模型 :video diffusion(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.20171 2025-05-27 cs.CV 57%

Long-Context State-Space Video World Models

Ryan Po, Yotam Nitzan, Richard Zhang, Berlin Chen, Tri Dao, Eli Shechtman, Gordon Wetzstein, Xun Huang

机构 * Stanford University(斯坦福大学) Princeton University(普林斯顿大学) Adobe Research(Adobe研究)

专题命中 视频扩散模型 :video diffusion(abstract);分类 cs.CV

Comments Project website: https://ryanpo.com/ssm_wm

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.12489 2025-05-22 cs.CV cs.AI 57%

Video-GPT via Next Clip Diffusion

Shaobin Zhuang, Zhipeng Huang, Ying Zhang, Fangyikang Wang, Canmiao Fu, Binxin Yang, Chong Sun, Chen Li, Yali Wang

机构 * Shanghai Jiao Tong University(上海交通大学) University of Science and Technology of China(中国科学技术大学) WeChat Vision, Tencent Inc.(腾讯微信视觉团队) Zhejiang University(浙江大学) Shenzhen Institutes of Advanced Technology, Chinese Academy of Sciences Shanghai AI Laboratory(深圳先进技术研究院、中国科学院上海人工智能实验室)

专题命中 视频扩散模型 :video generation(abstract);分类 cs.CV

Comments 22 pages, 12 figures, 18 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.14687 2025-05-21 cs.CV 57%

Grouping First, Attending Smartly: Training-Free Acceleration for Diffusion Transformers

Sucheng Ren, Qihang Yu, Ju He, Alan Yuille, Liang-Chieh Chen

机构 * Johns Hopkins University(约翰霍普金斯大学)

专题命中 视频扩散模型 :video generation(abstract);分类 cs.CV

Comments Project website at oliverrensu.github.io/project/GRAT

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.15661 2025-05-20 cs.CV 57%

DiTPainter: Efficient Video Inpainting with Diffusion Transformers

Xian Wu, Chang Liu

机构 * ByteDance(字节跳动)

专题命中 视频扩散模型 :video generation(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.11825 2025-05-20 cs.CV cs.AI 57%

Bootstrapping Diffusion: Diffusion Model Training Leveraging Partial and Corrupted Data

Xudong Ma

机构 * San Francisco, California(旧金山,加利福尼亚)

专题命中 视频扩散模型 :long video(abstract);分类 cs.CV

Comments 21 pages, 1 figure

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.21246 2025-05-20 cs.CV 57%

DynamiCtrl: Rethinking the Basic Structure and the Role of Text for High-quality Human Image Animation

Haoyu Zhao, Zhongang Qi, Cong Wang, Qingping Zheng, Guansong Lu, Fei Chen, Hang Xu, Zuxuan Wu

机构 * Fudan University(复旦大学) Huawei Noah’s Ark Lab(华为诺亚实验室) Sun Yat-sen University(中山大学) Zhejiang University(浙江大学)

专题命中 视频扩散模型 :video generation(abstract);分类 cs.CV

Comments 16 pages, 11 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.11245 2025-05-19 cs.CV 57%

Diffusion-NPO: Negative Preference Optimization for Better Preference Aligned Generation of Diffusion Models

Fu-Yun Wang, Yunhao Shui, Jingtan Piao, Keqiang Sun, Hongsheng Li

机构 * MMLab, CUHK, Hong Kong(CUHK的MMLab, 香港) Shanghai Jiang Tong University, Shanghai(上海江 Tong大学, 上海) CPII under InnoHK, Hong Kong(InnoHK下的CPII, 香港)

专题命中 视频扩散模型 :video diffusion(abstract);分类 cs.CV

Comments Accepted to ICLR 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.03562 2025-05-07 cs.CV cs.AI 57%

Real-Time Person Image Synthesis Using a Flow Matching Model

Jiwoo Jeong, Kirok Kim, Wooju Kim, Nam-Joon Kim

机构 * Department of Industrial Engineering, Yonsei University(延世大学工业工程系) Next-Generation Semiconductor, Seoul National University(首尔国立大学下一代半导体研究所)

专题命中 视频扩散模型 :video generation(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.14803 2025-05-06 cs.CV cs.RO 57%

Video Prediction Policy: A Generalist Robot Policy with Predictive Visual Representations

Yucheng Hu, Yanjiang Guo, Pengchao Wang, Xiaoyu Chen, Yen-Jen Wang, Jianke Zhang, Koushil Sreenath, Chaochao Lu, Jianyu Chen

专题命中 视频扩散模型 :video diffusion(abstract);分类 cs.CV

Comments ICML 2025 Spotlight Paper. The first two authors contribute equally

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.12091 2025-04-29 cs.CV 57%

Wonderland: Navigating 3D Scenes from a Single Image

Hanwen Liang, Junli Cao, Vidit Goel, Guocheng Qian, Sergei Korolev, Demetri Terzopoulos, Konstantinos N. Plataniotis, Sergey Tulyakov, Jian Ren

机构 * University of Toronto(多伦多大学) Snap Inc.(Snap公司) University of California, Los Angeles(加州大学洛杉矶分校)

专题命中 视频扩散模型 :video diffusion(abstract);分类 cs.CV

Comments Project page: https://snap-research.github.io/wonderland/

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.15786 2025-04-23 cs.CV 57%

Satellite to GroundScape -- Large-scale Consistent Ground View Generation from Satellite Views

Ningli Xu, Rongjun Qin

机构 * The Ohio State University(俄亥俄州立大学)

专题命中 视频扩散模型 :video generation(abstract);分类 cs.CV

Comments 8 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.11732 2025-04-17 cs.CV 57%

EgoExo-Gen: Ego-centric Video Prediction by Watching Exo-centric Videos

Jilan Xu, Yifei Huang, Baoqi Pei, Junlin Hou, Qingqiu Li, Guo Chen, Yuejie Zhang, Rui Feng, Weidi Xie

专题命中 视频扩散模型 :video diffusion(abstract);分类 cs.CV

Comments ICLR 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.11143 2025-04-16 cs.CV 57%

Taming Consistency Distillation for Accelerated Human Image Animation

Xiang Wang, Shiwei Zhang, Hangjie Yuan, Yujie Wei, Yingya Zhang, Changxin Gao, Yuehuan Wang, Nong Sang

专题命中 视频扩散模型 :video diffusion(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.08296 2025-04-14 cs.CV 57%

Generative AI for Film Creation: A Survey of Recent Advances

Ruihan Zhang, Borou Yu, Jiajian Min, Yetong Xin, Zheng Wei, Juncheng Nemo Shi, Mingzhen Huang, Xianghao Kong, Nix Liu Xin, Shanshan Jiang, Praagya Bahuguna, Mark Chan, Khushi Hora, Lijian Yang, Yongqi Liang, Runhe Bian, Yunlei Liu, Isabela Campillo Valencia, Patricia Morales Tredinick, Ilia Kozlov, Sijia Jiang, Peiwen Huang, Na Chen, Xuanxuan Liu, Anyi Rao

专题命中 视频扩散模型 :video diffusion(abstract);分类 cs.CV

Comments Accepted at CVPR 2025 CVEU workshop: AI for Creative Visual Content Generation Editing and Understanding

详情

展开后加载摘要…

URL PDF HTML 收藏
2409.16938 2025-04-14 cs.CV cs.AI cs.GR 57%

Generative Object Insertion in Gaussian Splatting with a Multi-View Diffusion Model

Hongliang Zhong, Can Wang, Jingbo Zhang, Jing Liao

专题命中 视频扩散模型 :video diffusion(abstract);分类 cs.CV

Comments Accepted by Visual Informatics. Project Page: https://github.com/JiuTongBro/MultiView_Inpaint

详情

展开后加载摘要…

URL PDF HTML 收藏
2406.02659 2025-04-09 q-bio.NC cs.AI cs.CV 57%

Reanimating Images using Neural Representations of Dynamic Stimuli

Jacob Yeung, Andrew F. Luo, Gabriel Sarch, Margaret M. Henderson, Deva Ramanan, Michael J. Tarr

专题命中 视频扩散模型 :video diffusion(abstract);分类 cs.CV

Comments Project Page: https://brain-nrds.github.io

Journal ref CVPR 2025 (oral)

详情

展开后加载摘要…

URL PDF HTML 收藏
2409.01876 2025-04-08 cs.CV cs.AI 57%

CyberHost: Taming Audio-driven Avatar Diffusion Model with Region Codebook Attention

Gaojie Lin, Jianwen Jiang, Chao Liang, Tianyun Zhong, Jiaqi Yang, Yanbo Zheng

专题命中 视频扩散模型 :video generation(abstract);分类 cs.CV

Comments ICLR 2025 (Oral), Homepage: https://cyberhost.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.03072 2025-04-07 cs.CV cs.LG 57%

How I Warped Your Noise: a Temporally-Correlated Noise Prior for Diffusion Models

Pascal Chang, Jingwei Tang, Markus Gross, Vinicius C. Azevedo

专题命中 视频扩散模型 :video generation(abstract);分类 cs.CV

Comments Accepted at ICLR 2024 (Oral)

详情

展开后加载摘要…

URL PDF HTML 收藏