arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

视频大模型

视频理解、视频生成、视频语言模型和时序视觉推理。

共收录 2148 信号源:cs.CV, eess.IV, cs.MM

1. 视频生成 2148 篇

2510.05096 2025-10-10 cs.CV cs.AI cs.CL cs.MA cs.MM 81%

Paper2Video: Automatic Video Generation from Scientific Papers

Zeyu Zhu, Kevin Qinghong Lin, Mike Zheng Shou

机构 * Show Lab, National University of Singapore(展示实验室,新加坡国立大学)

专题命中 视频生成 :video generation(title,abstract);分类 cs.CV、cs.MM

Comments Project Page: https://showlab.github.io/Paper2Video/

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.01284 2025-10-03 cs.MM cs.CV cs.SD eess.AS 81%

Ovi: Twin Backbone Cross-Modal Fusion for Audio-Video Generation

Chetwin Low, Weimin Wang, Calder Katyal

机构 * Character AI Yale University(耶鲁大学)

专题命中 视频生成 :video generation(title,abstract);分类 cs.CV、cs.MM

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.08519 2025-09-11 cs.CV cs.MM 81%

HuMo: Human-Centric Video Generation via Collaborative Multi-Modal Conditioning

Liyang Chen, Tianxiang Ma, Jiawei Liu, Bingchuan Li, Zhuowei Chen, Lijie Liu, Xu He, Gen Li, Qian He, Zhiyong Wu

机构 * Tsinghua University(清华大学) Intelligent Creation Lab, ByteDance(字节跳动智能创作实验室)

专题命中 视频生成 :video generation(title,abstract);分类 cs.CV、cs.MM

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.19836 2025-07-29 cs.GR cs.AI cs.CV cs.MM cs.SD 81%

ChoreoMuse: Robust Music-to-Dance Video Generation with Style Transfer and Beat-Adherent Motion

Xuanchen Wang, Heng Wang, Weidong Cai

机构 * School of Computer Science, The University of Sydney(计算机科学学院,悉尼大学)

专题命中 视频生成 :video generation(title,abstract);分类 cs.CV、cs.MM

Comments 10 pages, 5 figures, accepted by the 33rd ACM International Conference on Multimedia (ACM MM 2025), demo page: https://choreomuse.github.io

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.17388 2025-07-24 cs.CV eess.IV 81%

EndoGen: Conditional Autoregressive Endoscopic Video Generation

Xinyu Liu, Hengyu Liu, Cheng Wang, Tianming Liu, Yixuan Yuan

机构 * The Chinese University of Hong Kong, Hong Kong SAR(香港中文大学) University of Georgia(佐治亚大学)

专题命中 视频生成 :video generation(title,abstract);分类 cs.CV、eess.IV

Comments MICCAI 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.07449 2025-07-15 eess.IV cs.CV 81%

Ophora: A Large-Scale Data-Driven Text-Guided Ophthalmic Surgical Video Generation Model

Wei Li, Ming Hu, Guoan Wang, Lihao Liu, Kaijing Zhou, Junzhi Ning, Xin Guo, Zongyuan Ge, Lixu Gu, Junjun He

机构 * Shanghai Artificial Intelligence Laboratory, China(上海人工智能实验室) Shanghai Jiao Tong University, China(上海交通大学) Monash University, Australia(墨尔本大学) East China Normal University, China(华东师范大学) Eye Hospital, Wenzhou Medical University, China(温州医学院眼医院) Shanghai Academy of Artificial Intelligence for Science, China(上海人工智能科学研究院) Imperial College London, UK(伦敦帝国理工学院) Shanghai Innovation Institute, China(上海创新研究院)

专题命中 视频生成 :video generation(title,abstract);分类 cs.CV、eess.IV

Comments Early accepted in MICCAI25

详情

展开后加载摘要…

URL PDF HTML 收藏
2008.09646 2025-07-08 eess.IV cs.CV cs.LG 81%

HRVGAN: High Resolution Video Generation using Spatio-Temporal GAN

Abhinav Sagar

机构 * University of Maryland(马里兰大学) College Park, Maryland

专题命中 视频生成 :video generation(title,abstract);分类 cs.CV、eess.IV

详情

展开后加载摘要…

URL PDF HTML 收藏
2406.19680 2025-06-30 cs.CV cs.AI cs.MM 81%

MimicMotion: High-Quality Human Motion Video Generation with Confidence-aware Pose Guidance

Yuang Zhang, Jiaxi Gu, Li-Wen Wang, Han Wang, Junqi Cheng, Yuefeng Zhu, Fangyuan Zou

机构 * Tencent(腾讯) Shanghai Jiao Tong University(上海交通大学)

专题命中 视频生成 :video generation(title,abstract);分类 cs.CV、cs.MM

Comments ICML 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.18866 2025-06-24 cs.CV cs.AI cs.MM 81%

OmniAvatar: Efficient Audio-Driven Avatar Video Generation with Adaptive Body Animation

Qijun Gan, Ruizi Yang, Jianke Zhu, Shaofei Xue, Steven Hoi

专题命中 视频生成 :video generation(title,abstract);分类 cs.CV、cs.MM

Comments Project page: https://omni-avatar.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.03150 2025-06-04 cs.CV cs.AI cs.LG cs.MM 81%

IllumiCraft: Unified Geometry and Illumination Diffusion for Controllable Video Generation

Yuanze Lin, Yi-Wen Chen, Yi-Hsuan Tsai, Ronald Clark, Ming-Hsuan Yang

机构 * University of Oxford(牛津大学) UC Merced(加州大学默塞德分校) NEC Labs America(NEC美国实验室) Atmanity Inc.(Atmanity公司) Google DeepMind Project(谷歌DeepMind项目)

专题命中 视频生成 :video generation(title,abstract);分类 cs.CV、cs.MM

Comments Tech Report

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.24253 2025-06-02 cs.CV cs.AI cs.MM 81%

Interactive Video Generation via Domain Adaptation

Ishaan Rawal, Suryansh Kumar

专题命中 视频生成 :video generation(title,abstract);分类 cs.CV、cs.MM

Comments Preprint. Under Review

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.18597 2025-03-27 cs.CV cs.AI cs.MM 81%

DiTCtrl: Exploring Attention Control in Multi-Modal Diffusion Transformer for Tuning-Free Multi-Prompt Longer Video Generation

Minghong Cai, Xiaodong Cun, Xiaoyu Li, Wenze Liu, Zhaoyang Zhang, Yong Zhang, Ying Shan, Xiangyu Yue

专题命中 视频生成 :video generation(title,abstract);分类 cs.CV、cs.MM

Comments CVPR 2025; 21 pages, 23 figures, Project page: https://onevfall.github.io/project_page/ditctrl ; GitHub repository: https://github.com/TencentARC/DiTCtrl

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.02610 2025-02-06 cs.AI cs.CV cs.HC cs.MM 81%

Secure & Personalized Music-to-Video Generation via CHARCHA

Mehul Agarwal, Gauri Agarwal, Santiago Benoit, Andrew Lippman, Jean Oh

专题命中 视频生成 :video generation(title,abstract);分类 cs.CV、cs.MM

Comments NeurIPS 2024 Creative AI Track

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.03143 2024-10-15 eess.IV cs.CV cs.LG 81%

ECHOPulse: ECG controlled echocardio-grams video generation

Yiwei Li, Sekeun Kim, Zihao Wu, Hanqi Jiang, Yi Pan, Pengfei Jin, Sifan Song, Yucheng Shi, Tianming Liu, Quanzheng Li, Xiang Li

专题命中 视频生成 :video generation(title,abstract);分类 cs.CV、eess.IV

详情

展开后加载摘要…

URL PDF HTML 收藏
2409.16283 2024-09-25 cs.RO cs.CV cs.LG eess.IV 81%

Gen2Act: Human Video Generation in Novel Scenarios enables Generalizable Robot Manipulation

Homanga Bharadhwaj, Debidatta Dwibedi, Abhinav Gupta, Shubham Tulsiani, Carl Doersch, Ted Xiao, Dhruv Shah, Fei Xia, Dorsa Sadigh, Sean Kirmani

专题命中 视频生成 :video generation(title,abstract);分类 cs.CV、eess.IV

Comments Preprint. Under Review

详情

展开后加载摘要…

URL PDF HTML 收藏
2408.15217 2024-08-28 eess.IV cs.AI cs.CV 81%

Fundus2Video: Cross-Modal Angiography Video Generation from Static Fundus Photography with Clinical Knowledge Guidance

Weiyi Zhang, Siyu Huang, Jiancheng Yang, Ruoyu Chen, Zongyuan Ge, Yingfeng Zheng, Danli Shi, Mingguang He

专题命中 视频生成 :video generation(title,abstract);分类 cs.CV、eess.IV

Comments The paper has been accepted by Medical Image Computing and Computer Assisted Intervention Society (MICCAI) 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2407.21490 2024-08-01 eess.IV cs.AI cs.CV cs.LG 81%

Explainable and Controllable Motion Curve Guided Cardiac Ultrasound Video Generation

Junxuan Yu, Rusi Chen, Yongsong Zhou, Yanlin Chen, Yaofei Duan, Yuhao Huang, Han Zhou, Tan Tao, Xin Yang, Dong Ni

专题命中 视频生成 :video generation(title,abstract);分类 cs.CV、eess.IV

Comments Accepted by MICCAI MLMI 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2312.03641 2024-07-17 cs.CV cs.AI cs.LG cs.MM 81%

MotionCtrl: A Unified and Flexible Motion Controller for Video Generation

Zhouxia Wang, Ziyang Yuan, Xintao Wang, Tianshui Chen, Menghan Xia, Ping Luo, Ying Shan

专题命中 视频生成 :video generation(title,abstract);分类 cs.CV、cs.MM

Comments SIGGRAPH 2024 Conference Proceedings

详情

展开后加载摘要…

URL PDF HTML 收藏
2407.08944 2024-07-17 cs.CV eess.IV 81%

Bora: Biomedical Generalist Video Generation Model

Weixiang Sun, Xiaocao You, Ruizhe Zheng, Zhengqing Yuan, Xiang Li, Lifang He, Quanzheng Li, Lichao Sun

专题命中 视频生成 :video generation(title,abstract);分类 cs.CV、eess.IV

详情

展开后加载摘要…

URL PDF HTML 收藏
2404.14381 2024-04-23 cs.CV cs.MM 81%

TAVGBench: Benchmarking Text to Audible-Video Generation

Yuxin Mao, Xuyang Shen, Jing Zhang, Zhen Qin, Jinxing Zhou, Mochu Xiang, Yiran Zhong, Yuchao Dai

专题命中 视频生成 :video generation(title,abstract);分类 cs.CV、cs.MM

Comments Technical Report. Project page:https://github.com/OpenNLPLab/TAVGBench

详情

展开后加载摘要…

URL PDF HTML 收藏
2402.03040 2024-02-06 cs.CV cs.AI cs.LG cs.MM 81%

InteractiveVideo: User-Centric Controllable Video Generation with Synergistic Multimodal Instructions

Yiyuan Zhang, Yuhao Kang, Zhixin Zhang, Xiaohan Ding, Sanyuan Zhao, Xiangyu Yue

专题命中 视频生成 :video generation(title,abstract);分类 cs.CV、cs.MM

Comments Code, models, and demo are available at https://github.com/invictus717/InteractiveVideo

详情

展开后加载摘要…

URL PDF HTML 收藏
2311.06329 2023-11-14 cs.CV cs.AI cs.CL cs.LG eess.IV 81%

A Survey of AI Text-to-Image and AI Text-to-Video Generators

Aditi Singh

专题命中 视频生成 :text-to-video(title,abstract);分类 cs.CV、eess.IV

Comments 4 pages, 2 tables, 4th International Conference on Artificial Intelligence, Robotics and Control (AIRC 2023)

详情

展开后加载摘要…

URL PDF HTML 收藏
2311.03884 2023-11-08 eess.IV cs.CV 81%

MeVGAN: GAN-based Plugin Model for Video Generation with Applications in Colonoscopy

Łukasz Struski, Tomasz Urbańczyk, Krzysztof Bucki, Bartłomiej Cupiał, Aneta Kaczyńska, Przemysław Spurek, Jacek Tabor

专题命中 视频生成 :video generation(title,abstract);分类 cs.CV、eess.IV

详情

展开后加载摘要…

URL PDF HTML 收藏
2309.08009 2023-09-18 cs.CV cs.MM 81%

Measuring the Quality of Text-to-Video Model Outputs: Metrics and Dataset

Iya Chivileva, Philip Lynch, Tomas E. Ward, Alan F. Smeaton

专题命中 视频生成 :text-to-video(title,abstract);分类 cs.CV、cs.MM

Comments 13 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2303.16541 2023-06-16 cs.CV cs.AI cs.MM 81%

Sounding Video Generator: A Unified Framework for Text-guided Sounding Video Generation

Jiawei Liu, Weining Wang, Sihan Chen, Xinxin Zhu, Jing Liu

专题命中 视频生成 :video generation(title,abstract);分类 cs.CV、cs.MM

Journal ref IEEE Transactions on Multimedia 2023

详情

展开后加载摘要…

URL PDF HTML 收藏
2112.01832 2022-07-28 cs.MM cs.CV 81%

Lightweight Attentional Feature Fusion: A New Baseline for Text-to-Video Retrieval

Fan Hu, Aozhu Chen, Ziyue Wang, Fangming Zhou, Jianfeng Dong, Xirong Li

专题命中 视频生成 :text-to-video(title,abstract);分类 cs.CV、cs.MM

Comments Accepted by ECCV2022

详情

展开后加载摘要…

URL PDF HTML 收藏
2201.05986 2022-04-20 cs.CV cs.MM 81%

Audio-Driven Talking Face Video Generation with Dynamic Convolution Kernels

Zipeng Ye, Mengfei Xia, Ran Yi, Juyong Zhang, Yu-Kun Lai, Xuwei Huang, Guoxin Zhang, Yong-jin Liu

专题命中 视频生成 :video generation(title,abstract);分类 cs.CV、cs.MM

Comments in IEEE Transactions on Multimedia

详情

展开后加载摘要…

URL PDF HTML 收藏
2201.09168 2022-03-04 cs.CV cs.AI cs.MM 81%

Reading-strategy Inspired Visual Representation Learning for Text-to-Video Retrieval

Jianfeng Dong, Yabing Wang, Xianke Chen, Xiaoye Qu, Xirong Li, Yuan He, Xun Wang

专题命中 视频生成 :text-to-video(title,abstract);分类 cs.CV、cs.MM

Comments Accepted by IEEE Transactions on Circuits and Systems for Video Technology. Code is available at https://github.com/LiJiaBei-7/rivrl

详情

展开后加载摘要…

URL PDF HTML 收藏
2111.10233 2021-11-22 cs.CV cs.LG eess.IV 81%

Xp-GAN: Unsupervised Multi-object Controllable Video Generation

Bahman Rouhani, Mohammad Rahmati

专题命中 视频生成 :video generation(title,abstract);分类 cs.CV、eess.IV

Comments 8 pages, 9 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2110.11894 2021-10-26 cs.CV cs.MM 81%

Towards Using Clothes Style Transfer for Scenario-aware Person Video Generation

Jingning Xu, Benlai Tang, Mingjie Wang, Siyuan Bian, Wenyi Guo, Xiang Yin, Zejun Ma

专题命中 视频生成 :video generation(title,abstract);分类 cs.CV、cs.MM

详情

展开后加载摘要…

URL PDF HTML 收藏