arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

视频大模型

视频理解、视频生成、视频语言模型和时序视觉推理。

共收录 2160 信号源:cs.CV, eess.IV, cs.MM

1. 视频生成 2160 篇

2311.16813 2023-11-29 cs.CV 74%

Panacea: Panoramic and Controllable Video Generation for Autonomous Driving

Yuqing Wen, Yucheng Zhao, Yingfei Liu, Fan Jia, Yanhui Wang, Chong Luo, Chi Zhang, Tiancai Wang, Xiaoyan Sun, Xiangyu Zhang

专题命中 视频生成 :video generation(title);分类 cs.CV

Comments Project page: https://panacea-ad.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2304.10168 2023-11-03 cs.CV 74%

High-Fidelity and Freely Controllable Talking Head Video Generation

Yue Gao, Yuan Zhou, Jinglu Wang, Xiao Li, Xiang Ming, Yan Lu

专题命中 视频生成 :video generation(title);分类 cs.CV

Comments CVPR 2023

详情

展开后加载摘要…

URL PDF HTML 收藏
2206.14797 2023-08-10 cs.CV cs.LG 74%

3D-Aware Video Generation

Sherwin Bahmani, Jeong Joon Park, Despoina Paschalidou, Hao Tang, Gordon Wetzstein, Leonidas Guibas, Luc Van Gool, Radu Timofte

专题命中 视频生成 :video generation(title);分类 cs.CV

Comments TMLR 2023; Project page: https://sherwinbahmani.github.io/3dvidgen

详情

展开后加载摘要…

URL PDF HTML 收藏
2210.11182 2023-07-04 cs.CV 74%

Facial Expression Video Generation Based-On Spatio-temporal Convolutional GAN: FEV-GAN

Hamza Bouzid, Lahoucine Ballihi

专题命中 视频生成 :video generation(title);分类 cs.CV

Comments 13 pages, 8 figures, accepted in ISWA journal

Journal ref Intelligent Systems with Applications. 19 (2022)

详情

展开后加载摘要…

URL PDF HTML 收藏
2305.03983 2023-05-24 cs.CV 74%

Multi-object Video Generation from Single Frame Layouts

Yang Wu, Zhibin Liu, Hefeng Wu, Liang Lin

专题命中 视频生成 :video generation(title);分类 cs.CV

Comments 6 pages limit

详情

展开后加载摘要…

URL PDF HTML 收藏
2303.13744 2023-03-27 cs.CV 74%

Conditional Image-to-Video Generation with Latent Flow Diffusion Models

Haomiao Ni, Changhao Shi, Kai Li, Sharon X. Huang, Martin Renqiang Min

专题命中 视频生成 :video generation(title);分类 cs.CV

Comments CVPR 2023

详情

展开后加载摘要…

URL PDF HTML 收藏
2206.01651 2022-07-01 cs.CV 74%

D'ARTAGNAN: Counterfactual Video Generation

Hadrien Reynaud, Athanasios Vlontzos, Mischa Dombrowski, Ciarán Lee, Arian Beqiri, Paul Leeson, Bernhard Kainz

专题命中 视频生成 :video generation(title);分类 cs.CV

Comments Accepted for MICCAI 2022

详情

展开后加载摘要…

URL PDF HTML 收藏
2206.12845 2022-06-28 cs.CV cs.IR cs.LG 74%

RoME: Role-aware Mixture-of-Expert Transformer for Text-to-Video Retrieval

Burak Satar, Hongyuan Zhu, Hanwang Zhang, Joo Hwee Lim

专题命中 视频生成 :text-to-video(title);分类 cs.CV

Comments Preprint, under review in TCSVT Journal

详情

展开后加载摘要…

URL PDF HTML 收藏
2204.06558 2022-04-14 cs.CV cs.AI 74%

Controllable Video Generation through Global and Local Motion Dynamics

Aram Davtyan, Paolo Favaro

专题命中 视频生成 :video generation(title);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2108.04350 2021-08-11 cs.CV cs.AI 74%

VirtualConductor: Music-driven Conducting Video Generation System

Delong Chen, Fan Liu, Zewen Li, Feng Xu

专题命中 视频生成 :video generation(title);分类 cs.CV

Comments Accepted by IEEE International Conference on Multimedia and Expo (ICME) 2021, demo track. Best demo

详情

展开后加载摘要…

URL PDF HTML 收藏
2106.04283 2021-06-09 cs.SD cs.AI cs.CV cs.LG eess.AS 74%

NWT: Towards natural audio-to-video generation with representation learning

Rayhane Mama, Marc S. Tyndel, Hashiam Kadhim, Cole Clifford, Ragavan Thurairatnam

专题命中 视频生成 :video generation(title);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2106.03502 2021-06-09 cs.CV 74%

Efficient training for future video generation based on hierarchical disentangled representation of latent variables

Naoya Fushishita, Antonio Tejero-de-Pablos, Yusuke Mukuta, Tatsuya Harada

专题命中 视频生成 :video generation(title);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
1904.07538 2021-06-02 cs.CV 74%

Long-Term Human Video Generation of Multiple Futures Using Poses

Naoya Fushishita, Antonio Tejero-de-Pablos, Yusuke Mukuta, Tatsuya Harada

专题命中 视频生成 :video generation(title);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2007.06705 2021-03-26 cs.CV cs.LG stat.ML 74%

Unsupervised object-centric video generation and decomposition in 3D

Paul Henderson, Christoph H. Lampert

专题命中 视频生成 :video generation(title);分类 cs.CV

Comments Appeared at NeurIPS 2020. Project page: http://pmh47.net/o3v/

详情

展开后加载摘要…

URL PDF HTML 收藏
2012.10941 2021-01-05 cs.CV cs.AI 74%

Can Everybody Sign Now? Exploring Sign Language Video Generation from 2D Poses

Lucas Ventura, Amanda Duarte, Xavier Giro-i-Nieto

专题命中 视频生成 :video generation(title);分类 cs.CV

Comments Video here: https://youtu.be/4ve1sGzWl2g

详情

展开后加载摘要…

URL PDF HTML 收藏
1903.01434 2020-02-13 cs.CV cs.AI cs.LG 74%

VideoFlow: A Conditional Flow-Based Model for Stochastic Video Generation

Manoj Kumar, Mohammad Babaeizadeh, Dumitru Erhan, Chelsea Finn, Sergey Levine, Laurent Dinh, Durk Kingma

专题命中 视频生成 :video generation(title);分类 cs.CV

Comments ICLR 2020 Camera-Ready. Previous title: VideoFlow: A Flow-Based Generative Model for Video

详情

展开后加载摘要…

URL PDF HTML 收藏
1910.09139 2019-10-22 cs.CV cs.LG 74%

DwNet: Dense warp-based network for pose-guided human video generation

Polina Zablotskaia, Aliaksandr Siarohin, Bo Zhao, Leonid Sigal

专题命中 视频生成 :video generation(title);分类 cs.CV

Comments Accepted to BMVC 2019

详情

展开后加载摘要…

URL PDF HTML 收藏
1907.06571 2019-09-26 cs.CV cs.LG stat.ML 74%

Adversarial Video Generation on Complex Datasets

Aidan Clark, Jeff Donahue, Karen Simonyan

专题命中 视频生成 :video generation(title);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
1905.12245 2019-05-30 cs.MM 74%

Automatic Realistic Music Video Generation from Segments of Youtube Videos

Sarah Gross, Xingxing Wei, Jun Zhu

专题命中 视频生成 :video generation(title);分类 cs.MM

详情

展开后加载摘要…

URL PDF HTML 收藏
1904.11521 2019-04-29 cs.CV 74%

Face Video Generation from a Single Image and Landmarks

Kritaphat Songsri-in, Stefanos Zafeiriou

专题命中 视频生成 :video generation(title);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
1903.00913 2019-03-05 cs.CV 74%

Unsupervised Bi-directional Flow-based Video Generation from one Snapshot

Lu Sheng, Junting Pan, Jiaming Guo, Jing Shao, Xiaogang Wang, Chen Change Loy

专题命中 视频生成 :video generation(title);分类 cs.CV

Comments 11 pages, 12 figures. Technical report for a project in progress

详情

展开后加载摘要…

URL PDF HTML 收藏
1901.11384 2019-02-01 cs.CV cs.LG stat.ML 74%

Learning to navigate image manifolds induced by generative adversarial networks for unsupervised video generation

Isabela Albuquerque, João Monteiro, Tiago H. Falk

专题命中 视频生成 :video generation(title);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
1807.11152 2018-07-31 cs.CV 74%

Pose Guided Human Video Generation

Ceyuan Yang, Zhe Wang, Xinge Zhu, Chen Huang, Jianping Shi, Dahua Lin

专题命中 视频生成 :video generation(title);分类 cs.CV

Comments Accepted to ECCV 2018

详情

展开后加载摘要…

URL PDF HTML 收藏
1807.09951 2018-07-27 cs.CV 74%

Learning to Forecast and Refine Residual Motion for Image-to-Video Generation

Long Zhao, Xi Peng, Yu Tian, Mubbasir Kapadia, Dimitris Metaxas

专题命中 视频生成 :video generation(title);分类 cs.CV

Comments 17 pages, 8 figures, 4 tables, accepted by ECCV 2018

详情

展开后加载摘要…

URL PDF HTML 收藏
1710.00421 2017-10-03 cs.MM 74%

Video Generation From Text

Yitong Li, Martin Renqiang Min, Dinghan Shen, David Carlson, Lawrence Carin

专题命中 视频生成 :video generation(title);分类 cs.MM

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.16184 2026-06-16 cs.CV cs.MM 新提交 73%

Closed-Loop Triplet Synergistic Generation for Long-Form Video

闭环三元组协同生成用于长视频

Xinlei Yin, Xiulian Peng, Xiao Li, Zhiwei Xiong, Yan Lu

机构 * University of Science and Technology of China(中国科学技术大学) Microsoft Research Asia(微软亚洲研究院)

专题命中 视频生成 :video generation(abstract);long video(abstract);分类 cs.CV、cs.MM

AI总结 提出CoTriSyGen框架,通过闭环视觉-文本-记忆协同过程,结合分析器进行镜头内和镜头间修正,解决长视频生成中的身份漂移和不一致问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.05290 2026-06-05 cs.CV cs.AI cs.MM 73%

Do Models Share Safety Representations? Cross-Model Steering for Safe Visual Generation

模型是否共享安全表示?面向安全视觉生成的跨模型引导

Tobia Poppi, Silvia Cappelletti, Sara Sarto, Florian Schiffers, Garin Kessler, Marcella Cornia, Lorenzo Baraldi, Rita Cucchiara

机构 * University of Modena and Reggio Emilia(摩德纳和雷吉奥艾米利亚大学) University of Pisa(比萨大学) Amazon Prime Video(亚马逊prime视频)

专题命中 视频生成 :video generation(abstract);text-to-video(abstract);分类 cs.CV、cs.MM

AI总结 本文提出首个跨模型安全引导框架,通过源语言模型估计安全方向并迁移至目标生成器,无需目标侧不安全数据即可实现安全控制,且不牺牲生成质量。

Comments Project page: https://aimagelab.github.io/cross-model-safety-representations/

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.23325 2026-04-28 cs.CV cs.AI eess.IV 73%

EAD-Net: Emotion-Aware Talking Head Generation with Spatial Refinement and Temporal Coherence

EAD-Net:具有空间细化和时间一致性的情感感知说话头生成

Yahui Li, Yinfeng Yu, Liejun Wang, Shengjie Shen

机构 * School of Computer Science and Technology, Xinjiang University(新疆大学计算机科学与技术学院)

专题命中 视频生成 :video generation(abstract);long video(abstract);分类 cs.CV、eess.IV

AI总结 EAD-Net通过引入同步网络监督和时空方向注意力机制,提升情感感知说话头生成的唇同步精度和时间一致性,同时利用大语言模型增强情感语义控制。

Comments Main paper (10 pages). Accepted for publication by ICMR(International Conference on Multimedia Retrieval) 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.14476 2025-09-22 cs.CV cs.AI cs.MM 73%

AToken: A Unified Tokenizer for Vision

Jiasen Lu, Liangchen Song, Mingze Xu, Byeongjoo Ahn, Yanjun Wang, Chen Chen, Afshin Dehghan, Yinfei Yang

专题命中 视频生成 :video generation(abstract);text-to-video(abstract);分类 cs.CV、cs.MM

Comments 30 pages, 14 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.20109 2025-03-24 cs.CV cs.AI cs.MM 73%

GiVE: Guiding Visual Encoder to Perceive Overlooked Information

Junjie Li, Jianghong Ma, Xiaofeng Zhang, Yuhang Li, Jianyang Shi

专题命中 视频生成 :video generation(abstract);text-to-video(abstract);分类 cs.CV、cs.MM

Comments This paper was accepted by ICME 2025

详情

展开后加载摘要…

URL PDF HTML 收藏