arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

视频大模型

视频理解、视频生成、视频语言模型和时序视觉推理。

共收录 6840 信号源:cs.CV, eess.IV, cs.MM

1. 视频生成 2171 篇

2506.03150 2025-06-04 cs.CV cs.AI cs.LG cs.MM 81%

IllumiCraft: Unified Geometry and Illumination Diffusion for Controllable Video Generation

Yuanze Lin, Yi-Wen Chen, Yi-Hsuan Tsai, Ronald Clark, Ming-Hsuan Yang

机构 * University of Oxford(牛津大学) UC Merced(加州大学默塞德分校) NEC Labs America(NEC美国实验室) Atmanity Inc.(Atmanity公司) Google DeepMind Project(谷歌DeepMind项目)

专题命中 视频生成 :video generation(title,abstract);分类 cs.CV、cs.MM

Comments Tech Report

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.24253 2025-06-02 cs.CV cs.AI cs.MM 81%

Interactive Video Generation via Domain Adaptation

Ishaan Rawal, Suryansh Kumar

专题命中 视频生成 :video generation(title,abstract);分类 cs.CV、cs.MM

Comments Preprint. Under Review

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.18597 2025-03-27 cs.CV cs.AI cs.MM 81%

DiTCtrl: Exploring Attention Control in Multi-Modal Diffusion Transformer for Tuning-Free Multi-Prompt Longer Video Generation

Minghong Cai, Xiaodong Cun, Xiaoyu Li, Wenze Liu, Zhaoyang Zhang, Yong Zhang, Ying Shan, Xiangyu Yue

机构 * MMLab, CUHK(香港中文大学多媒体实验室) GVC Lab, Great Bay University(大湾区大学GVC实验室) ARC Lab, Tencent PCG(腾讯平台与内容事业群ARC实验室) Tencent AI Lab(腾讯AI实验室) SHIAE, CUHK(香港中文大学SHIAE实验室)

专题命中 视频生成 :video generation(title,abstract);分类 cs.CV、cs.MM

Comments CVPR 2025; 21 pages, 23 figures, Project page: https://onevfall.github.io/project_page/ditctrl ; GitHub repository: https://github.com/TencentARC/DiTCtrl

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.02610 2025-02-06 cs.AI cs.CV cs.HC cs.MM 81%

Secure & Personalized Music-to-Video Generation via CHARCHA

Mehul Agarwal, Gauri Agarwal, Santiago Benoit, Andrew Lippman, Jean Oh

机构 * Carnegie Mellon University(卡内基梅隆大学) MIT Media Lab(麻省理工学院媒体实验室)

专题命中 视频生成 :video generation(title,abstract);分类 cs.CV、cs.MM

Comments NeurIPS 2024 Creative AI Track

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.03143 2024-10-15 eess.IV cs.CV cs.LG 81%

ECHOPulse: ECG controlled echocardio-grams video generation

Yiwei Li, Sekeun Kim, Zihao Wu, Hanqi Jiang, Yi Pan, Pengfei Jin, Sifan Song, Yucheng Shi, Tianming Liu, Quanzheng Li, Xiang Li

专题命中 视频生成 :video generation(title,abstract);分类 cs.CV、eess.IV

详情

展开后加载摘要…

URL PDF HTML 收藏
2409.16283 2024-09-25 cs.RO cs.CV cs.LG eess.IV 81%

Gen2Act: Human Video Generation in Novel Scenarios enables Generalizable Robot Manipulation

Homanga Bharadhwaj, Debidatta Dwibedi, Abhinav Gupta, Shubham Tulsiani, Carl Doersch, Ted Xiao, Dhruv Shah, Fei Xia, Dorsa Sadigh, Sean Kirmani

专题命中 视频生成 :video generation(title,abstract);分类 cs.CV、eess.IV

Comments Preprint. Under Review

详情

展开后加载摘要…

URL PDF HTML 收藏
2408.15217 2024-08-28 eess.IV cs.AI cs.CV 81%

Fundus2Video: Cross-Modal Angiography Video Generation from Static Fundus Photography with Clinical Knowledge Guidance

Weiyi Zhang, Siyu Huang, Jiancheng Yang, Ruoyu Chen, Zongyuan Ge, Yingfeng Zheng, Danli Shi, Mingguang He

专题命中 视频生成 :video generation(title,abstract);分类 cs.CV、eess.IV

Comments The paper has been accepted by Medical Image Computing and Computer Assisted Intervention Society (MICCAI) 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2407.21490 2024-08-01 eess.IV cs.AI cs.CV cs.LG 81%

Explainable and Controllable Motion Curve Guided Cardiac Ultrasound Video Generation

Junxuan Yu, Rusi Chen, Yongsong Zhou, Yanlin Chen, Yaofei Duan, Yuhao Huang, Han Zhou, Tan Tao, Xin Yang, Dong Ni

专题命中 视频生成 :video generation(title,abstract);分类 cs.CV、eess.IV

Comments Accepted by MICCAI MLMI 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2312.03641 2024-07-17 cs.CV cs.AI cs.LG cs.MM 81%

MotionCtrl: A Unified and Flexible Motion Controller for Video Generation

Zhouxia Wang, Ziyang Yuan, Xintao Wang, Tianshui Chen, Menghan Xia, Ping Luo, Ying Shan

专题命中 视频生成 :video generation(title,abstract);分类 cs.CV、cs.MM

Comments SIGGRAPH 2024 Conference Proceedings

详情

展开后加载摘要…

URL PDF HTML 收藏
2407.08944 2024-07-17 cs.CV eess.IV 81%

Bora: Biomedical Generalist Video Generation Model

Weixiang Sun, Xiaocao You, Ruizhe Zheng, Zhengqing Yuan, Xiang Li, Lifang He, Quanzheng Li, Lichao Sun

专题命中 视频生成 :video generation(title,abstract);分类 cs.CV、eess.IV

详情

展开后加载摘要…

URL PDF HTML 收藏
2404.14381 2024-04-23 cs.CV cs.MM 81%

TAVGBench: Benchmarking Text to Audible-Video Generation

Yuxin Mao, Xuyang Shen, Jing Zhang, Zhen Qin, Jinxing Zhou, Mochu Xiang, Yiran Zhong, Yuchao Dai

专题命中 视频生成 :video generation(title,abstract);分类 cs.CV、cs.MM

Comments Technical Report. Project page:https://github.com/OpenNLPLab/TAVGBench

详情

展开后加载摘要…

URL PDF HTML 收藏
2402.03040 2024-02-06 cs.CV cs.AI cs.LG cs.MM 81%

InteractiveVideo: User-Centric Controllable Video Generation with Synergistic Multimodal Instructions

Yiyuan Zhang, Yuhao Kang, Zhixin Zhang, Xiaohan Ding, Sanyuan Zhao, Xiangyu Yue

专题命中 视频生成 :video generation(title,abstract);分类 cs.CV、cs.MM

Comments Code, models, and demo are available at https://github.com/invictus717/InteractiveVideo

详情

展开后加载摘要…

URL PDF HTML 收藏
2311.06329 2023-11-14 cs.CV cs.AI cs.CL cs.LG eess.IV 81%

A Survey of AI Text-to-Image and AI Text-to-Video Generators

Aditi Singh

专题命中 视频生成 :text-to-video(title,abstract);分类 cs.CV、eess.IV

Comments 4 pages, 2 tables, 4th International Conference on Artificial Intelligence, Robotics and Control (AIRC 2023)

详情

展开后加载摘要…

URL PDF HTML 收藏
2311.03884 2023-11-08 eess.IV cs.CV 81%

MeVGAN: GAN-based Plugin Model for Video Generation with Applications in Colonoscopy

Łukasz Struski, Tomasz Urbańczyk, Krzysztof Bucki, Bartłomiej Cupiał, Aneta Kaczyńska, Przemysław Spurek, Jacek Tabor

专题命中 视频生成 :video generation(title,abstract);分类 cs.CV、eess.IV

详情

展开后加载摘要…

URL PDF HTML 收藏
2309.08009 2023-09-18 cs.CV cs.MM 81%

Measuring the Quality of Text-to-Video Model Outputs: Metrics and Dataset

Iya Chivileva, Philip Lynch, Tomas E. Ward, Alan F. Smeaton

专题命中 视频生成 :text-to-video(title,abstract);分类 cs.CV、cs.MM

Comments 13 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2303.16541 2023-06-16 cs.CV cs.AI cs.MM 81%

Sounding Video Generator: A Unified Framework for Text-guided Sounding Video Generation

Jiawei Liu, Weining Wang, Sihan Chen, Xinxin Zhu, Jing Liu

专题命中 视频生成 :video generation(title,abstract);分类 cs.CV、cs.MM

Journal ref IEEE Transactions on Multimedia 2023

详情

展开后加载摘要…

URL PDF HTML 收藏
2112.01832 2022-07-28 cs.MM cs.CV 81%

Lightweight Attentional Feature Fusion: A New Baseline for Text-to-Video Retrieval

Fan Hu, Aozhu Chen, Ziyue Wang, Fangming Zhou, Jianfeng Dong, Xirong Li

专题命中 视频生成 :text-to-video(title,abstract);分类 cs.CV、cs.MM

Comments Accepted by ECCV2022

详情

展开后加载摘要…

URL PDF HTML 收藏
2201.05986 2022-04-20 cs.CV cs.MM 81%

Audio-Driven Talking Face Video Generation with Dynamic Convolution Kernels

Zipeng Ye, Mengfei Xia, Ran Yi, Juyong Zhang, Yu-Kun Lai, Xuwei Huang, Guoxin Zhang, Yong-jin Liu

专题命中 视频生成 :video generation(title,abstract);分类 cs.CV、cs.MM

Comments in IEEE Transactions on Multimedia

详情

展开后加载摘要…

URL PDF HTML 收藏
2201.09168 2022-03-04 cs.CV cs.AI cs.MM 81%

Reading-strategy Inspired Visual Representation Learning for Text-to-Video Retrieval

Jianfeng Dong, Yabing Wang, Xianke Chen, Xiaoye Qu, Xirong Li, Yuan He, Xun Wang

专题命中 视频生成 :text-to-video(title,abstract);分类 cs.CV、cs.MM

Comments Accepted by IEEE Transactions on Circuits and Systems for Video Technology. Code is available at https://github.com/LiJiaBei-7/rivrl

详情

展开后加载摘要…

URL PDF HTML 收藏
2111.10233 2021-11-22 cs.CV cs.LG eess.IV 81%

Xp-GAN: Unsupervised Multi-object Controllable Video Generation

Bahman Rouhani, Mohammad Rahmati

专题命中 视频生成 :video generation(title,abstract);分类 cs.CV、eess.IV

Comments 8 pages, 9 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2110.11894 2021-10-26 cs.CV cs.MM 81%

Towards Using Clothes Style Transfer for Scenario-aware Person Video Generation

Jingning Xu, Benlai Tang, Mingjie Wang, Siyuan Bian, Wenyi Guo, Xiang Yin, Zejun Ma

专题命中 视频生成 :video generation(title,abstract);分类 cs.CV、cs.MM

详情

展开后加载摘要…

URL PDF HTML 收藏
2107.04806 2021-07-15 cs.SD cs.CV eess.AS eess.IV 81%

Speech2Video: Cross-Modal Distillation for Speech to Video Generation

Shijing Si, Jianzong Wang, Xiaoyang Qu, Ning Cheng, Wenqi Wei, Xinghua Zhu, Jing Xiao

专题命中 视频生成 :video generation(title,abstract);分类 cs.CV、eess.IV

Comments Accepted by InterSpeech2021

详情

展开后加载摘要…

URL PDF HTML 收藏
2105.14678 2021-06-01 cs.CV eess.IV 81%

Image-to-Video Generation via 3D Facial Dynamics

Xiaoguang Tu, Yingtian Zou, Jian Zhao, Wenjie Ai, Jian Dong, Yuan Yao, Zhikang Wang, Guodong Guo, Zhifeng Li, Wei Liu, Jiashi Feng

专题命中 视频生成 :video generation(title,abstract);分类 cs.CV、eess.IV

详情

展开后加载摘要…

URL PDF HTML 收藏
2102.09737 2021-02-22 cs.CV cs.SD eess.AS eess.IV 81%

One Shot Audio to Animated Video Generation

Neeraj Kumar, Srishti Goel, Ankur Narang, Brejesh Lall, Mujtaba Hasan, Pranshu Agarwal, Dipankar Sarkar

专题命中 视频生成 :video generation(title,abstract);分类 cs.CV、eess.IV

Comments arXiv admin note: substantial text overlap with arXiv:2012.07842, arXiv:2012.07304

详情

展开后加载摘要…

URL PDF HTML 收藏
2004.01823 2020-11-12 cs.CV cs.LG eess.IV 81%

Temporal Shift GAN for Large Scale Video Generation

Andres Munoz, Mohammadreza Zolfaghari, Max Argus, Thomas Brox

专题命中 视频生成 :video generation(title,abstract);分类 cs.CV、eess.IV

Comments 14 pages, 15 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.08048 2026-06-23 cs.CV 版本更新 80%

S^2VG: 3D Stereoscopic and Spatial Video Generation via Denoising Frame Matrix

S^2VG:基于去噪帧矩阵的3D立体与空间视频生成

Peng Dai, Feitong Tan, Qiangeng Xu, Yihua Huang, David Futschik, Ruofei Du, Sean Fanello, Yinda Zhang, Xiaojuan Qi

机构 * Department of Electrical and Electronic Engineering at The University of Hong Kong(香港大学电子与电气工程系) Google(谷歌)

专题命中 视频生成 :video generation(title,abstract);分类 cs.CV

AI总结 提出一种无需姿态和训练的方法,利用现成单目视频生成模型,通过深度图扭曲和帧矩阵修复框架,生成时空一致的3D立体与空间视频。

Comments immersive video generation, 4D scene, spatial video, stereo video

详情

展开后加载摘要…

URL PDF HTML 收藏
2308.06571 2023-08-15 cs.CV cs.AI 80%

ModelScope Text-to-Video Technical Report

Jiuniu Wang, Hangjie Yuan, Dayou Chen, Yingya Zhang, Xiang Wang, Shiwei Zhang

专题命中 视频生成 :text-to-video(title,abstract);分类 cs.CV

Comments Technical report. Project page: \url{https://modelscope.cn/models/damo/text-to-video-synthesis/summary}

详情

展开后加载摘要…

URL PDF HTML 收藏
1909.12400 2019-09-30 cs.CV 80%

Markov Decision Process for Video Generation

Vladyslav Yushchenko, Nikita Araslanov, Stefan Roth

专题命中 视频生成 :video generation(title,abstract);分类 cs.CV;video understanding(comments)

Comments To appear at 2019 ICCV Workshop on Large Scale Holistic Video Understanding

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.26902 2026-08-28 cs.CV 新提交 79%

Tether the Subject, Release the Scene: Query-Aware Memory Routing for Long-Horizon Autoregressive Video Generation

绑定主体,释放场景:面向长时序自回归视频生成的查询感知记忆路由

Chen Li, Peng Zhang, Hanyu Zhou, Jialong Zuo, Fei Wang, Daiguo Zhou, Nong Sang, Changxin Gao

机构 * Huazhong University of Science and Technology(华中科技大学) MiLM Plus, Xiaomi Inc.(小米公司MiLM Plus)

专题命中 视频生成 :video generation(title);long video(abstract);分类 cs.CV

AI总结 针对流式自回归视频生成中记忆锚定的场景欠进展问题,提出无需训练的查询感知时空记忆路由器 TetherMem,分离主体与场景查询调节历史访问,在长视频生成的整体质量与场景进展指标上优于基线方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.26214 2026-08-28 cs.CV 新提交 79%

Surgical Video Generation From Diffusion to World Models: A Survey

手术视频生成:从扩散模型到世界模型:综述

Fuxiang Huang, Chenxu Zhang, Liang Han, Lei Zhang

专题命中 视频生成 :video generation(title,abstract);分类 cs.CV

AI总结 该综述梳理2024-2026年手术视频生成领域文献,分三类总结方法,指出生成任务从合成帧转向建模场景因果动态,分析瓶颈并提供实验参考,为相关交叉领域研究者提供参考。

Comments 4 pages, 1 figures, 3 tables. Accepted for oral presentation at the 2026 3rd International Conference on Intelligent Perception and Pattern Recognition (IPPR 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏