arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

视频大模型

视频理解、视频生成、视频语言模型和时序视觉推理。

共收录 2158 信号源:cs.CV, eess.IV, cs.MM

1. 视频生成 2158 篇

2404.15275 2024-06-26 cs.CV 79%

ID-Animator: Zero-Shot Identity-Preserving Human Video Generation

Xuanhua He, Quande Liu, Shengju Qian, Xin Wang, Tao Hu, Ke Cao, Keyu Yan, Jie Zhang

专题命中 视频生成 :video generation(title,abstract);分类 cs.CV

Comments Project Page: https://id-animator.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2406.16862 2024-06-25 cs.RO cs.CV 79%

Dreamitate: Real-World Visuomotor Policy Learning via Video Generation

Junbang Liang, Ruoshi Liu, Ege Ozguroglu, Sruthi Sudhakar, Achal Dave, Pavel Tokmakov, Shuran Song, Carl Vondrick

专题命中 视频生成 :video generation(title);video diffusion(abstract);分类 cs.CV

Comments Project page: https://dreamitate.cs.columbia.edu/

详情

展开后加载摘要…

URL PDF HTML 收藏
2406.02511 2024-06-05 cs.CV cs.AI 79%

V-Express: Conditional Dropout for Progressive Training of Portrait Video Generation

Cong Wang, Kuan Tian, Jun Zhang, Yonghang Guan, Feng Luo, Fei Shen, Zhiwei Jiang, Qing Gu, Xiao Han, Wei Yang

专题命中 视频生成 :video generation(title,abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2312.14125 2024-06-05 cs.CV cs.AI 79%

VideoPoet: A Large Language Model for Zero-Shot Video Generation

Dan Kondratyuk, Lijun Yu, Xiuye Gu, José Lezama, Jonathan Huang, Grant Schindler, Rachel Hornung, Vighnesh Birodkar, Jimmy Yan, Ming-Chang Chiu, Krishna Somandepalli, Hassan Akbari, Yair Alon, Yong Cheng, Josh Dillon, Agrim Gupta, Meera Hahn, Anja Hauth, David Hendon, Alonso Martinez, David Minnen, Mikhail Sirotenko, Kihyuk Sohn, Xuan Yang, Hartwig Adam, Ming-Hsuan Yang, Irfan Essa, Huisheng Wang, David A. Ross, Bryan Seybold, Lu Jiang

专题命中 视频生成 :video generation(title,abstract);分类 cs.CV

Comments To appear at ICML 2024; Project page: http://sites.research.google/videopoet/

详情

展开后加载摘要…

URL PDF HTML 收藏
2402.16627 2024-06-05 cs.CV cs.AI cs.LG 79%

Contextualized Diffusion Models for Text-Guided Image and Video Generation

Ling Yang, Zhilong Zhang, Zhaochen Yu, Jingwei Liu, Minkai Xu, Stefano Ermon, Bin Cui

专题命中 视频生成 :video generation(title);text-to-video(abstract);分类 cs.CV

Comments ICLR 2024. Project: https://github.com/YangLing0818/ContextDiff

详情

展开后加载摘要…

URL PDF HTML 收藏
2405.18003 2024-05-29 cs.CV cs.AI 79%

MAVIN: Multi-Action Video Generation with Diffusion Models via Transition Video Infilling

Bowen Zhang, Xiaofei Xie, Haotian Lu, Na Ma, Tianlin Li, Qing Guo

专题命中 视频生成 :video generation(title,abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2405.13195 2024-05-24 cs.CV cs.AI 79%

CamViG: Camera Aware Image-to-Video Generation with Multimodal Transformers

Andrew Marmon, Grant Schindler, José Lezama, Dan Kondratyuk, Bryan Seybold, Irfan Essa

专题命中 视频生成 :video generation(title,abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2405.06547 2024-05-13 cs.CV 79%

OneTo3D: One Image to Re-editable Dynamic 3D Model and Video Generation

Jinwei Lin

专题命中 视频生成 :video generation(title,abstract);分类 cs.CV

Comments 24 pages, 13 figures, 2 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2405.03025 2024-05-13 cs.CV 79%

Matten: Video Generation with Mamba-Attention

Yu Gao, Jiancheng Huang, Xiaopeng Sun, Zequn Jie, Yujie Zhong, Lin Ma

专题命中 视频生成 :video generation(title,abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2405.04180 2024-05-08 cs.LG cs.CV 79%

Sora Detector: A Unified Hallucination Detection for Large Text-to-Video Models

Zhixuan Chu, Lei Zhang, Yichen Sun, Siqiao Xue, Zhibo Wang, Zhan Qin, Kui Ren

专题命中 视频生成 :text-to-video(title,abstract);分类 cs.CV

Comments arXiv admin note: text overlap with arXiv:2306.08302, arXiv:2403.05131 by other authors

详情

展开后加载摘要…

URL PDF HTML 收藏
2312.07509 2024-04-23 cs.CV cs.LG 79%

PEEKABOO: Interactive Video Generation via Masked-Diffusion

Yash Jain, Anshul Nasery, Vibhav Vineet, Harkirat Behl

专题命中 视频生成 :video generation(title,abstract);分类 cs.CV

Comments Project webpage - https://jinga-lala.github.io/projects/Peekaboo/

详情

展开后加载摘要…

URL PDF HTML 收藏
2403.06845 2024-04-12 cs.CV 79%

DriveDreamer-2: LLM-Enhanced World Models for Diverse Driving Video Generation

Guosheng Zhao, Xiaofeng Wang, Zheng Zhu, Xinze Chen, Guan Huang, Xiaoyi Bao, Xingang Wang

专题命中 视频生成 :video generation(title,abstract);分类 cs.CV

Comments Project Page: https://drivedreamer2.github.io

详情

展开后加载摘要…

URL PDF HTML 收藏
2401.00896 2024-04-10 cs.CV 79%

TrailBlazer: Trajectory Control for Diffusion-Based Video Generation

Wan-Duo Kurt Ma, J. P. Lewis, W. Bastiaan Kleijn

专题命中 视频生成 :video generation(title);text-to-video(abstract);分类 cs.CV

Comments 14 pages, 18 figures, Project Page: https://hohonu-vicml.github.io/Trailblazer.Page/

详情

展开后加载摘要…

URL PDF HTML 收藏
2312.03459 2024-03-29 cs.CV 79%

F3-Pruning: A Training-Free and Generalized Pruning Strategy towards Faster and Finer Text-to-Video Synthesis

Sitong Su, Jianzhi Liu, Lianli Gao, Jingkuan Song

专题命中 视频生成 :text-to-video(title,abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2403.11050 2024-03-19 cs.CV 79%

Endora: Video Generation Models as Endoscopy Simulators

Chenxin Li, Hengyu Liu, Yifan Liu, Brandon Y. Feng, Wuyang Li, Xinyu Liu, Zhen Chen, Jing Shao, Yixuan Yuan

专题命中 视频生成 :video generation(title,abstract);分类 cs.CV

Comments Project page: https://endora-medvidgen.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2403.09194 2024-03-19 cs.CV 79%

Intention-driven Ego-to-Exo Video Generation

Hongchen Luo, Kai Zhu, Wei Zhai, Yang Cao

专题命中 视频生成 :video generation(title,abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
1802.07687 2024-03-14 cs.CV cs.AI cs.LG stat.ML 79%

Stochastic Video Generation with a Learned Prior

Remi Denton, Rob Fergus

专题命中 视频生成 :video generation(title,abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2403.06356 2024-03-12 cs.CV cs.AI 79%

Video Generation with Consistency Tuning

Chaoyi Wang, Yaozhe Song, Yafeng Zhang, Jun Pei, Lijie Xia, Jianpo Liu

专题命中 视频生成 :video generation(title);long video(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2403.02827 2024-03-06 cs.CV 79%

Tuning-Free Noise Rectification for High Fidelity Image-to-Video Generation

Weijie Li, Litong Gong, Yiran Zhu, Fanda Fan, Biao Wang, Tiezheng Ge, Bo Zheng

专题命中 视频生成 :video generation(title);video diffusion(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2403.01800 2024-03-06 cs.CV 79%

AtomoVideo: High Fidelity Image-to-Video Generation

Litong Gong, Yiran Zhu, Weijie Li, Xiaoyang Kang, Biao Wang, Tiezheng Ge, Bo Zheng

专题命中 视频生成 :video generation(title,abstract);分类 cs.CV

Comments Technical report. Page: https://atomo-video.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2310.05922 2024-03-04 cs.CV 79%

FLATTEN: optical FLow-guided ATTENtion for consistent text-to-video editing

Yuren Cong, Mengmeng Xu, Christian Simon, Shoufa Chen, Jiawei Ren, Yanping Xie, Juan-Manuel Perez-Rua, Bodo Rosenhahn, Tao Xiang, Sen He

专题命中 视频生成 :text-to-video(title,abstract);分类 cs.CV

Comments Accepted by ICLR2024. Project page: https://flatten-video-editing.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2401.15977 2024-02-01 cs.CV 79%

Motion-I2V: Consistent and Controllable Image-to-Video Generation with Explicit Motion Modeling

Xiaoyu Shi, Zhaoyang Huang, Fu-Yun Wang, Weikang Bian, Dasong Li, Yi Zhang, Manyuan Zhang, Ka Chun Cheung, Simon See, Hongwei Qin, Jifeng Dai, Hongsheng Li

专题命中 视频生成 :video generation(title,abstract);分类 cs.CV

Comments Project page: https://xiaoyushi97.github.io/Motion-I2V/

详情

展开后加载摘要…

URL PDF HTML 收藏
2401.09084 2024-01-18 cs.CV 79%

UniVG: Towards UNIfied-modal Video Generation

Ludan Ruan, Lei Tian, Chuanwei Huang, Xu Zhang, Xinyan Xiao

专题命中 视频生成 :video generation(title,abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2306.03988 2024-01-17 cs.CV cs.AI 79%

Learn the Force We Can: Enabling Sparse Motion Control in Multi-Object Video Generation

Aram Davtyan, Paolo Favaro

专题命中 视频生成 :video generation(title,abstract);分类 cs.CV

Comments Accepted to AAAI 2024. Project website: https://araachie.github.io/yoda

详情

展开后加载摘要…

URL PDF HTML 收藏
2401.00701 2024-01-02 cs.CV 79%

Towards Efficient and Effective Text-to-Video Retrieval with Coarse-to-Fine Visual Representation Learning

Kaibin Tian, Yanhua Cheng, Yi Liu, Xinglin Hou, Quan Chen, Han Li

专题命中 视频生成 :text-to-video(title,abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2312.05107 2023-12-12 cs.CV 79%

DreaMoving: A Human Video Generation Framework based on Diffusion Models

Mengyang Feng, Jinlin Liu, Kai Yu, Yuan Yao, Zheng Hui, Xiefan Guo, Xianhui Lin, Haolan Xue, Chen Shi, Xiaowen Li, Aojie Li, Xiaoyang Kang, Biwen Lei, Miaomiao Cui, Peiran Ren, Xuansong Xie

专题命中 视频生成 :video generation(title,abstract);分类 cs.CV

Comments 5 pages, 5 figures, Tech. Report

详情

展开后加载摘要…

URL PDF HTML 收藏
2312.04561 2023-12-08 cs.CV 79%

GenDeF: Learning Generative Deformation Field for Video Generation

Wen Wang, Kecheng Zheng, Qiuyu Wang, Hao Chen, Zifan Shi, Ceyuan Yang, Yujun Shen, Chunhua Shen

专题命中 视频生成 :video generation(title,abstract);分类 cs.CV

Comments Project page: https://aim-uofa.github.io/GenDeF/

详情

展开后加载摘要…

URL PDF HTML 收藏
2312.00777 2023-12-04 cs.CV 79%

VideoBooth: Diffusion-based Video Generation with Image Prompts

Yuming Jiang, Tianxing Wu, Shuai Yang, Chenyang Si, Dahua Lin, Yu Qiao, Chen Change Loy, Ziwei Liu

专题命中 视频生成 :video generation(title,abstract);分类 cs.CV

Comments Project page: https://vchitect.github.io/VideoBooth-project/

详情

展开后加载摘要…

URL PDF HTML 收藏
2311.00298 2023-11-02 cs.CV 79%

An Empirical Study of Frame Selection for Text-to-Video Retrieval

Mengxia Wu, Min Cao, Yang Bai, Ziyin Zeng, Chen Chen, Liqiang Nie, Min Zhang

专题命中 视频生成 :text-to-video(title,abstract);分类 cs.CV

Comments Accepted by 2023 EMNLP findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2307.12964 2023-10-20 cs.CV 79%

Audio-Enhanced Text-to-Video Retrieval using Text-Conditioned Feature Alignment

Sarah Ibrahimi, Xiaohang Sun, Pichao Wang, Amanmeet Garg, Ashutosh Sanan, Mohamed Omar

专题命中 视频生成 :text-to-video(title,abstract);分类 cs.CV

Comments Proceedings of the IEEE/CVF International Conference on Computer Vision. 2023

详情

展开后加载摘要…

URL PDF HTML 收藏