arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

视频大模型

视频理解、视频生成、视频语言模型和时序视觉推理。

共收录 1306 信号源:cs.CV, eess.IV, cs.MM

1. 视频扩散模型 1306 篇

2508.07905 2025-08-12 cs.CV 57%

Generative Video Matting

Yongtao Ge, Kangyang Xie, Guangkai Xu, Mingyu Liu, Li Ke, Longtao Huang, Hui Xue, Hao Chen, Chunhua Shen

机构 * The University of Adelaide(阿德莱德大学) Zhejiang University(浙江大学) Alibaba Group(阿里巴巴集团) Zhejiang University of Technology(浙江工业大学)

专题命中 视频扩散模型 :video diffusion(abstract);分类 cs.CV

Journal ref SIGGRAPH Conference Papers 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.07603 2025-08-12 cs.CV 57%

LaVieID: Local Autoregressive Diffusion Transformers for Identity-Preserving Video Creation

Wenhui Song, Hanhui Li, Jiehui Huang, Panwen Hu, Yuhao Cheng, Long Chen, Yiqiang Yan, Xiaodan Liang

机构 * Shenzhen Campus of Sun Yat-sen University(中山大学深圳校区) Hong Kong University of Science and Technology(香港科学与技术大学) Mohamed bin Zayed University of Artificial Intelligence(马尔代夫 bin Zayed 人工智能大学) Lenovo Research(联想研究)

专题命中 视频扩散模型 :text-to-video(abstract);分类 cs.CV

Comments Accepted to ACM MM 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.07557 2025-08-12 cs.CV 57%

Splat4D: Diffusion-Enhanced 4D Gaussian Splatting for Temporally and Spatially Consistent Content Creation

Minghao Yin, Yukang Cao, Songyou Peng, Kai Han

机构 * The University of Hong Kong(香港大学) Nanyang Technological University(南洋理工大学) Google DeepMind(谷歌DeepMind)

专题命中 视频扩散模型 :video diffusion(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.07246 2025-08-12 cs.CV 57%

Consistent and Controllable Image Animation with Motion Linear Diffusion Transformers

Xin Ma, Yaohui Wang, Genyun Jia, Xinyuan Chen, Tien-Tsin Wong, Cunjian Chen

机构 * Department of Data Science & AI, Faculty of Information Technology, Monash University(数据科学与人工智能系,信息科技学院,墨尔本大学) Nanjing University of Posts and Telecommunications(南京邮电大学) Shanghai Artificial Intelligence Laboratory(上海人工智能实验室)

专题命中 视频扩散模型 :text-to-video(abstract);分类 cs.CV

Comments Project Page: https://maxin-cn.github.io/miramo_project

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.21205 2025-08-12 cs.CV 57%

EF-VI: Enhancing End-Frame Injection for Video Inbetweening

Liuhan Chen, Xiaodong Cun, Xiaoyu Li, Xianyi He, Shenghai Yuan, Jie Chen, Ying Shan, Li Yuan

机构 * Shenzhen Graduate School, Peking University(北京大学深圳研究生院) GVC Lab, Great Bay University(大湾大学GVC实验室) ARC Lab, Tencent PCG(腾讯PCG ARC实验室) Rabbitpre Intelligence(Rabbitpre智能)

专题命中 视频扩散模型 :video diffusion(abstract);分类 cs.CV

Comments 17 pages, 11 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.06014 2025-08-11 cs.CV 57%

ExploreGS: Explorable 3D Scene Reconstruction with Virtual Camera Samplings and Diffusion Priors

Minsu Kim, Subin Jeon, In Cho, Mijin Yoo, Seon Joo Kim

机构 * Yonsei University(延世大学)

专题命中 视频扩散模型 :video diffusion(abstract);分类 cs.CV

Comments 10 pages, 6 Figures, ICCV 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.01603 2025-08-08 cs.CV 57%

DepthSync: Diffusion Guidance-Based Depth Synchronization for Scale- and Geometry-Consistent Video Depth Estimation

Yue-Jiang Dong, Wang Zhao, Jiale Xu, Ying Shan, Song-Hai Zhang

机构 * Tsinghua University(清华大学) ARC Lab, Tencent PCG(腾讯PCG实验室)

专题命中 视频扩散模型 :long video(abstract);分类 cs.CV

Comments Accepted by ICCV 2025; Project Homepage: https://yuejiangdong.github.io/depthsync

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.03480 2025-08-06 cs.CV cs.AI 57%

VideoGuard: Protecting Video Content from Unauthorized Editing

Junjie Cao, Kaizhou Li, Xinchun Yu, Hongxiang Li, Xiaoping Zhang

专题命中 视频扩散模型 :video diffusion(abstract);分类 cs.CV

Comments ai security, 10pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.02807 2025-08-06 cs.CV 57%

DreamVVT: Mastering Realistic Video Virtual Try-On in the Wild via a Stage-Wise Diffusion Transformer Framework

Tongchun Zuo, Zaiyu Huang, Shuliang Ning, Ente Lin, Chao Liang, Zerong Zheng, Jianwen Jiang, Yuan Zhang, Mingyuan Gao, Xin Dong

机构 * ByteDance Intelligent Creation(字节跳动智能创作)

专题命中 视频扩散模型 :video generation(abstract);分类 cs.CV

Comments 18 pages, 12 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.14404 2025-08-06 cs.CV cs.AI 57%

Causally Steered Diffusion for Automated Video Counterfactual Generation

Nikos Spyrou, Athanasios Vlontzos, Paraskevas Pegios, Thomas Melistas, Nefeli Gkouti, Yannis Panagakis, Giorgos Papanastasiou, Sotirios A. Tsaftaris

机构 * Spotify, UK(英国Spotify)

专题命中 视频扩散模型 :video generation(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.12049 2025-08-05 cs.CV 57%

TACO: Taming Diffusion for in-the-wild Video Amodal Completion

Ruijie Lu, Yixin Chen, Yu Liu, Jiaxiang Tang, Junfeng Ni, Diwen Wan, Gang Zeng, Siyuan Huang

机构 * State Key Laboratory of General Artificial Intelligence, Peking University(北京大学通用人工智能国家重点实验室) State Key Laboratory of General Artificial Intelligence, BIGAI(BIGAI 通用人工智能国家重点实验室) Tsinghua University(清华大学)

专题命中 视频扩散模型 :video diffusion(abstract);分类 cs.CV

Comments Accepted by ICCV 2025.Project page: https://jason-aplp.github.io/TACO

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.15580 2025-08-05 cs.CV 57%

TKG-DM: Training-free Chroma Key Content Generation Diffusion Model

Ryugo Morita, Stanislav Frolov, Brian Bernhard Moser, Takahiro Shirakawa, Ko Watanabe, Andreas Dengel, Jinjia Zhou

机构 * Faculty of Science and Engineering(科学与工程学部) RPTU Kaiserslautern-Landau & DFKI GmbH(科隆-兰道大学与DFKI GmbH)

专题命中 视频扩散模型 :text-to-video(abstract);分类 cs.CV

Comments Accepted to CVPR2025(Highlight). Code at: https://github.com/ryugo417/TKG-DM

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.20158 2025-07-29 cs.CV 57%

AnimeColor: Reference-based Animation Colorization with Diffusion Transformers

Yuhong Zhang, Liyao Wang, Han Wang, Danni Wu, Zuzeng Lin, Feng Wang, Li Song

机构 * Shanghai Jiao Tong University(上海交通大学) Tianjin University(天津大学) Communication University of China(中国通信大学)

专题命中 视频扩散模型 :video diffusion(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.08714 2025-07-29 cs.CV cs.AI 57%

Versatile Multimodal Controls for Expressive Talking Human Animation

Zheng Qin, Ruobing Zheng, Yabing Wang, Tianqi Li, Zixin Zhu, Sanping Zhou, Ming Yang, Le Wang

机构 * National Key Laboratory of Human-Machine Hybrid Augmented Intelligence, Xi'an Jiaotong University, Ant Group(人机混合增强智能国家级实验室,西安交通大学,蚂蚁集团) National Key Laboratory of Human-Machine Hybrid Augmented Intelligence, Xi'an Jiaotong University(人机混合增强智能国家级实验室,西安交通大学) University at Buffalo(布法罗大学)

专题命中 视频扩散模型 :video diffusion(abstract);分类 cs.CV

Comments Accepted by ACM MM2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2409.03456 2025-07-29 cs.CV 57%

LM-Gaussian: Boost Sparse-view 3D Gaussian Splatting with Large Model Priors

Hanyang Yu, Xiaoxiao Long, Ping Tan

专题命中 视频扩散模型 :video diffusion(abstract);分类 cs.CV

Comments Project page: https://hanyangyu1021.github.io/lm-gaussian.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.15064 2025-07-22 cs.CV cs.AI 57%

StableAnimator++: Overcoming Pose Misalignment and Face Distortion for Human Image Animation

Shuyuan Tu, Zhen Xing, Xintong Han, Zhi-Qi Cheng, Qi Dai, Chong Luo, Zuxuan Wu, Yu-Gang Jiang

机构 * School of Computer Science, Fudan University(复旦大学计算机科学学院) Microsoft Research Asia(微软亚洲研究院) Tencent Inc.(腾讯公司) University of Washington(华盛顿大学)

专题命中 视频扩散模型 :video diffusion(abstract);分类 cs.CV

Comments arXiv admin note: substantial text overlap with arXiv:2411.17697

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.05763 2025-07-09 cs.CV 57%

DreamArt: Generating Interactable Articulated Objects from a Single Image

Ruijie Lu, Yu Liu, Jiaxiang Tang, Junfeng Ni, Yuxiang Wang, Diwen Wan, Gang Zeng, Yixin Chen, Siyuan Huang

机构 * State Key Lab of General AI, Peking University(北京大学通用人工智能国家重点实验室) Tsinghua University(清华大学) State Key Lab of General AI, BIGAI(通用人工智能国家重点实验室,BIGAI)

专题命中 视频扩散模型 :video diffusion(abstract);分类 cs.CV

Comments Technical Report

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.01717 2025-07-09 cs.CV 57%

Driving View Synthesis on Free-form Trajectories with Generative Prior

Zeyu Yang, Zijie Pan, Yuankun Yang, Xiatian Zhu, Li Zhang

机构 * Fudan University(复旦大学) University of Surrey(Surrey大学)

专题命中 视频扩散模型 :video diffusion(abstract);分类 cs.CV

Comments ICCV 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.05198 2025-07-08 cs.RO cs.AI cs.CV 57%

EmbodieDreamer: Advancing Real2Sim2Real Transfer for Policy Training via Embodied World Modeling

Boyuan Wang, Xinpan Meng, Xiaofeng Wang, Zheng Zhu, Angen Ye, Yang Wang, Zhiqin Yang, Chaojun Ni, Guan Huang, Xingang Wang

机构 * GigaAI Institute of Automation, Chinese Academy of Sciences(自动化研究所) Peking University(北京大学)

专题命中 视频扩散模型 :video diffusion(abstract);分类 cs.CV

Comments Project Page: https://embodiedreamer.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.01380 2025-07-08 cs.CV cs.AI 57%

Playing with Transformer at 30+ FPS via Next-Frame Diffusion

Xinle Cheng, Tianyu He, Jiayi Xu, Junliang Guo, Di He, Jiang Bian

机构 * Peking University(北京大学) Microsoft Research(微软研究院)

专题命中 视频扩散模型 :video generation(abstract);分类 cs.CV

Comments Project page: https://nextframed.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.02299 2025-07-04 cs.CV 57%

DreamComposer++: Empowering Diffusion Models with Multi-View Conditions for 3D Content Generation

Yunhan Yang, Shuo Chen, Yukun Huang, Xiaoyang Wu, Yuan-Chen Guo, Edmund Y. Lam, Hengshuang Zhao, Tong He, Xihui Liu

机构 * The University of Hong Kong(香港大学) Tsinghua University(清华大学) Vast Shanghai AI Laboratory(上海人工智能实验室)

专题命中 视频扩散模型 :video diffusion(abstract);分类 cs.CV

Comments Accepted by TPAMI, extension of CVPR 2024 paper DreamComposer

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.04320 2025-07-03 cs.CV cs.LG 57%

ConceptAttention: Diffusion Transformers Learn Highly Interpretable Features

Alec Helbling, Tuna Han Salih Meral, Ben Hoover, Pinar Yanardag, Duen Horng Chau

机构 * ibm(IBM研究院)

专题命中 视频扩散模型 :video generation(abstract);分类 cs.CV

Comments Oral Presentation at ICML 2025, Best Paper Award at CVPR Workshop on Visual Concepts

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.05255 2025-07-02 cs.CV cs.LG 57%

Bridging SFT and DPO for Diffusion Model Alignment with Self-Sampling Preference Optimization

Daoan Zhang, Guangchen Lan, Dong-Jun Han, Wenlin Yao, Xiaoman Pan, Hongming Zhang, Mingxiao Li, Pengcheng Chen, Yu Dong, Christopher Brinton, Jiebo Luo

机构 * University of Rochester(罗切斯特大学) Purdue University(普渡大学) Yonsei University(延世大学) Tencent AI Lab(腾讯AI实验室) University of Washington(华盛顿大学)

专题命中 视频扩散模型 :text-to-video(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.10507 2025-07-01 cs.GR cs.CV 57%

Edit360: 2D Image Edits to 3D Assets from Any Angle

Junchao Huang, Xinting Hu, Shaoshuai Shi, Zhuotao Tian, Li Jiang

机构 * The Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳)) Nanyang Technological University(南洋理工大学) Harbin Institute of Technology, Shenzhen(哈尔滨工业大学(深圳)) Voyager Research, Didi Chuxing(Voyager Research与滴滴出行)

专题命中 视频扩散模型 :video diffusion(abstract);分类 cs.CV

Comments 11 pages, 9 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.22298 2025-06-30 cs.CV 57%

OutDreamer: Video Outpainting with a Diffusion Transformer

Linhao Zhong, Fan Li, Yi Huang, Jianzhuang Liu, Renjing Pei, Fenglong Song

机构 * Shanghai Jiao Tong University(上海交通大学) Huawei Noah’s Ark Lab(华为诺亚实验室) Shenzhen Institute of Advanced Technology, Chinese Academy of Sciences(深圳先进技术研究院,中国科学院)

专题命中 视频扩散模型 :long video(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.21270 2025-06-27 cs.CV 57%

Video Virtual Try-on with Conditional Diffusion Transformer Inpainter

Cheng Zou, Senlin Cheng, Bolei Xu, Dandan Zheng, Xiaobo Li, Jingdong Chen, Ming Yang

机构 * Ant Group(蚂蚁集团)

专题命中 视频扩散模型 :video generation(abstract);分类 cs.CV

Comments 10 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.20946 2025-06-27 cs.GR cs.AI cs.CV 57%

Consistent Zero-shot 3D Texture Synthesis Using Geometry-aware Diffusion and Temporal Video Models

Donggoo Kang, Jangyeong Kim, Dasol Jeong, Junyoung Choi, Jeonga Wi, Hyunmin Lee, Joonho Gwon, Joonki Paik

机构 * Department of Image, Chung-Ang University(Chung-Ang大学图像系) Graphics AI Lab, NCSOFT(NCSOFT图形AI实验室) Department of Computer Science, University of Seoul(首尔大学计算机科学系)

专题命中 视频扩散模型 :video generation(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.19851 2025-06-25 cs.CV 57%

AnimaX: Animating the Inanimate in 3D with Joint Video-Pose Diffusion Models

Zehuan Huang, Haoran Feng, Yangtian Sun, Yuanchen Guo, Yanpei Cao, Lu Sheng

机构 * Beihang University(北航) Tsinghua University(清华大学) The University of Hong Kong(香港大学)

专题命中 视频扩散模型 :video diffusion(abstract);分类 cs.CV

Comments Project page: https://anima-x.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.19798 2025-06-25 cs.CV 57%

CoCo4D: Comprehensive and Complex 4D Scene Generation

Junwei Zhou, Xueting Li, Lu Qi, Ming-Hsuan Yang

机构 * Huazhong University of Science and Technology(华中科技大学) NVIDIA Wuhan University(武汉大学) Insta360 Research(Insta360研究院) UC Merced(加州大学默塞德分校)

专题命中 视频扩散模型 :video diffusion(abstract);分类 cs.CV

Comments 16 pages,10 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.07497 2025-06-23 cs.CV 57%

Genesis: Multimodal Driving Scene Generation with Spatio-Temporal and Cross-Modal Consistency

Xiangyu Guo, Zhanqian Wu, Kaixin Xiong, Ziyang Xu, Lijun Zhou, Gangwei Xu, Shaoqing Xu, Haiyang Sun, Bing Wang, Guang Chen, Hangjun Ye, Wenyu Liu, Xinggang Wang

机构 * Huazhong University of Science and Technology(华中科技大学) Xiaomi EV(小米电动车)

专题命中 视频扩散模型 :video diffusion(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏