arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

视频大模型

视频理解、视频生成、视频语言模型和时序视觉推理。

共收录 6823 信号源:cs.CV, eess.IV, cs.MM

1. 视频生成 2160 篇

2506.05554 2025-06-09 cs.CV 70%

EX-4D: EXtreme Viewpoint 4D Video Synthesis via Depth Watertight Mesh

Tao Hu, Haoyang Peng, Xiao Liu, Yuewen Ma

机构 * Pico, Bytedance(字节跳动)

专题命中 视频生成 :video generation(abstract);video diffusion(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.04216 2025-06-05 cs.CV 70%

UNIC: Unified In-Context Video Editing

Zixuan Ye, Xuanhua He, Quande Liu, Qiulin Wang, Xintao Wang, Pengfei Wan, Di Zhang, Kun Gai, Qifeng Chen, Wenhan Luo

机构 * The Hong Kong University of Science and Technology(香港科学与技术大学) Kuaishou Technology(快手科技)

专题命中 视频生成 :video generation(abstract);text-to-video(abstract);分类 cs.CV

Comments The project page is at \href{https://zixuan-ye.github.io/UNIC}{https://zixuan-ye.github.io/UNIC}

详情

展开后加载摘要…

URL PDF HTML 收藏
2407.11784 2025-06-05 cs.AI cs.CV cs.LG 70%

Data-Juicer Sandbox: A Feedback-Driven Suite for Multimodal Data-Model Co-development

Daoyuan Chen, Haibin Wang, Yilun Huang, Ce Ge, Yaliang Li, Bolin Ding, Jingren Zhou

专题命中 视频生成 :video generation(abstract);text-to-video(abstract);分类 cs.CV

Comments Accepted by ICML 2025 (Spotlight). 33 pages, 16 tables, 14 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.24873 2025-06-02 cs.CV 70%

MiniMax-Remover: Taming Bad Noise Helps Video Object Removal

Bojia Zi, Weixuan Peng, Xianbiao Qi, Jianan Wang, Shihao Zhao, Rong Xiao, Kam-Fai Wong

专题命中 视频生成 :video generation(abstract);video diffusion(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.00135 2025-05-02 cs.CV 70%

Eye2Eye: A Simple Approach for Monocular-to-Stereo Video Synthesis

Michal Geyer, Omer Tov, Linyi Jin, Richard Tucker, Inbar Mosseri, Tali Dekel, Noah Snavely

机构 * Google DeepMind(谷歌DeepMind) Weizmann Institute of Science(魏茨曼科学研究院) University of Michigan(密歇根大学)

专题命中 视频生成 :video generation(abstract);text-to-video(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.06666 2025-04-10 cs.CV 70%

Patch Matters: Training-free Fine-grained Image Caption Enhancement via Local Perception

Ruotian Peng, Haiying He, Yake Wei, Yandong Wen, Di Hu

专题命中 视频生成 :video generation(abstract);text-to-video(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.04471 2025-04-01 cs.CV cs.AI 70%

PaintScene4D: Consistent 4D Scene Generation from Text Prompts

Vinayak Gupta, Yunze Man, Yu-Xiong Wang

专题命中 视频生成 :video generation(abstract);text-to-video(abstract);分类 cs.CV

Comments Preprint. Project page: https://paintscene4d.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.21824 2025-03-31 cs.CV cs.CR 70%

Protecting Your Video Content: Disrupting Automated Video-based LLM Annotations

Haitong Liu, Kuofeng Gao, Yang Bai, Jinmin Li, Jinxiao Shan, Tao Dai, Shu-Tao Xia

专题命中 视频生成 :video generation(abstract);text-to-video(abstract);分类 cs.CV

Comments Accepted by CVPR 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.19907 2025-03-26 cs.CV 70%

FullDiT: Multi-Task Video Generative Foundation Model with Full Attention

Xuan Ju, Weicai Ye, Quande Liu, Qiulin Wang, Xintao Wang, Pengfei Wan, Di Zhang, Kun Gai, Qiang Xu

专题命中 视频生成 :video generation(abstract);text-to-video(abstract);分类 cs.CV

Comments Project Page: https://fulldit.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2409.08601 2025-03-25 cs.SD cs.MM eess.AS 70%

STA-V2A: Video-to-Audio Generation with Semantic and Temporal Alignment

Yong Ren, Chenxing Li, Manjie Xu, Wei Liang, Yu Gu, Rilin Chen, Dong Yu

专题命中 视频生成 :video generation(abstract);text-to-video(abstract);分类 cs.MM

Comments ICASSP 2025-2025 IEEE International Conference on Acoustics, Speech and Signal Processing (ICASSP)

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.17048 2025-03-18 cs.CV 70%

PersonalVideo: High ID-Fidelity Video Customization without Dynamic and Semantic Degradation

Hengjia Li, Haonan Qiu, Shiwei Zhang, Xiang Wang, Yujie Wei, Zekun Li, Yingya Zhang, Boxi Wu, Deng Cai

专题命中 视频生成 :video generation(abstract);text-to-video(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.03758 2025-02-27 cs.CV 70%

ARCON: Advancing Auto-Regressive Continuation for Driving Videos

Ruibo Ming, Jingwei Wu, Zhewei Huang, Zhuoxuan Ju, Jianming HU, Lihui Peng, Shuchang Zhou

专题命中 视频生成 :video generation(abstract);long video(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.04896 2025-02-11 cs.CV 70%

Goku: Flow Based Video Generative Foundation Models

Shoufa Chen, Chongjian Ge, Yuqi Zhang, Yida Zhang, Fengda Zhu, Hao Yang, Hongxiang Hao, Hui Wu, Zhichao Lai, Yifei Hu, Ting-Che Lin, Shilong Zhang, Fu Li, Chuan Li, Xing Wang, Yanghua Peng, Peize Sun, Ping Luo, Yi Jiang, Zehuan Yuan, Bingyue Peng, Xiaobing Liu

专题命中 视频生成 :video generation(abstract);text-to-video(abstract);分类 cs.CV

Comments Demo: https://saiyan-world.github.io/goku/

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.13190 2025-01-09 cs.CV 70%

MotionBridge: Dynamic Video Inbetweening with Flexible Controls

Maham Tanveer, Yang Zhou, Simon Niklaus, Ali Mahdavi Amiri, Hao Zhang, Krishna Kumar Singh, Nanxuan Zhao

专题命中 视频生成 :video generation(abstract);long video(abstract);分类 cs.CV

Comments Project website: [https://motionbridge.github.io/]

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.20404 2024-12-31 cs.CV 70%

Open-Sora: Democratizing Efficient Video Production for All

Zangwei Zheng, Xiangyu Peng, Tianji Yang, Chenhui Shen, Shenggui Li, Hongxin Liu, Yukun Zhou, Tianyi Li, Yang You

专题命中 视频生成 :video generation(abstract);text-to-video(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2405.18407 2024-12-05 cs.LG cs.CV 70%

Phased Consistency Models

Fu-Yun Wang, Zhaoyang Huang, Alexander William Bergman, Dazhong Shen, Peng Gao, Michael Lingelbach, Keqiang Sun, Weikang Bian, Guanglu Song, Yu Liu, Xiaogang Wang, Hongsheng Li

专题命中 视频生成 :video generation(abstract);text-to-video(abstract);分类 cs.CV

Comments NeurIPS 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2403.17920 2024-10-16 cs.CV 70%

TC4D: Trajectory-Conditioned Text-to-4D Generation

Sherwin Bahmani, Xian Liu, Wang Yifan, Ivan Skorokhodov, Victor Rong, Ziwei Liu, Xihui Liu, Jeong Joon Park, Sergey Tulyakov, Gordon Wetzstein, Andrea Tagliasacchi, David B. Lindell

专题命中 视频生成 :video generation(abstract);text-to-video(abstract);分类 cs.CV

Comments ECCV 2024; Project Page: https://sherwinbahmani.github.io/tc4d

详情

展开后加载摘要…

URL PDF HTML 收藏
2405.18750 2024-10-14 cs.CV 70%

T2V-Turbo: Breaking the Quality Bottleneck of Video Consistency Model with Mixed Reward Feedback

Jiachen Li, Weixi Feng, Tsu-Jui Fu, Xinyi Wang, Sugato Basu, Wenhu Chen, William Yang Wang

专题命中 视频生成 :video generation(abstract);text-to-video(abstract);分类 cs.CV

Comments Project page: https://t2v-turbo.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.07194 2024-10-11 cs.CV cs.AI 70%

Technical Report: Competition Solution For Modelscope-Sora

Shengfu Chen, Hailong Liu, Wenzhao Wei

专题命中 视频生成 :video generation(abstract);text-to-video(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2409.14888 2024-09-24 cs.CV 70%

Advancing Video Quality Assessment for AIGC

Xinli Yue, Jianhui Sun, Han Kong, Liangchao Yao, Tianyi Wang, Lei Li, Fengyun Rao, Jing Lv, Fan Xia, Yuetang Deng, Qian Wang, Lingchen Zhao

专题命中 视频生成 :video generation(abstract);text-to-video(abstract);分类 cs.CV

Comments 5 pages, 1 figure

详情

展开后加载摘要…

URL PDF HTML 收藏
2408.10119 2024-08-20 cs.CV cs.AI 70%

Factorized-Dreamer: Training A High-Quality Video Generator with Limited and Low-Quality Data

Tao Yang, Yangming Shi, Yunwen Huang, Feng Chen, Yin Zheng, Lei Zhang

专题命中 视频生成 :video generation(abstract);text-to-video(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2408.08315 2024-08-19 cs.CV cs.AI 70%

Segment Anything for Videos: A Systematic Survey

Chunhui Zhang, Yawen Cui, Weilin Lin, Guanjie Huang, Yan Rong, Li Liu, Shiguang Shan

专题命中 视频生成 :video generation(abstract);video understanding(abstract);分类 cs.CV

Comments https://github.com/983632847/SAM-for-Videos

详情

展开后加载摘要…

URL PDF HTML 收藏
2312.02216 2024-07-23 cs.GR cs.CV 70%

DragVideo: Interactive Drag-style Video Editing

Yufan Deng, Ruida Wang, Yuhao Zhang, Yu-Wing Tai, Chi-Keung Tang

专题命中 视频生成 :video generation(abstract);video diffusion(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2312.17142 2024-06-11 cs.CV cs.GR 70%

DreamGaussian4D: Generative 4D Gaussian Splatting

Jiawei Ren, Liang Pan, Jiaxiang Tang, Chi Zhang, Ang Cao, Gang Zeng, Ziwei Liu

专题命中 视频生成 :video generation(abstract);video diffusion(abstract);分类 cs.CV

Comments Technical report. Project page is at https://jiawei-ren.github.io/projects/dreamgaussian4d Code is at https://github.com/jiawei-ren/dreamgaussian4d

详情

展开后加载摘要…

URL PDF HTML 收藏
2308.12605 2024-05-03 cs.CV cs.AI 70%

APLA: Additional Perturbation for Latent Noise with Adversarial Training Enables Consistency

Yupu Yao, Shangqi Deng, Zihan Cao, Harry Zhang, Liang-Jian Deng

专题命中 视频生成 :video generation(abstract);text-to-video(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2402.17177 2024-04-19 cs.CV cs.AI cs.LG 70%

Sora: A Review on Background, Technology, Limitations, and Opportunities of Large Vision Models

Yixin Liu, Kai Zhang, Yuan Li, Zhiling Yan, Chujie Gao, Ruoxi Chen, Zhengqing Yuan, Yue Huang, Hanchi Sun, Jianfeng Gao, Lifang He, Lichao Sun

专题命中 视频生成 :video generation(abstract);text-to-video(abstract);分类 cs.CV

Comments 37 pages, 18 figures; GitHub: https://github.com/lichao-sun/SoraReview

详情

展开后加载摘要…

URL PDF HTML 收藏
2401.06129 2024-04-17 cs.CV 70%

Distilling Vision-Language Models on Millions of Videos

Yue Zhao, Long Zhao, Xingyi Zhou, Jialin Wu, Chun-Te Chu, Hui Miao, Florian Schroff, Hartwig Adam, Ting Liu, Boqing Gong, Philipp Krähenbühl, Liangzhe Yuan

专题命中 视频生成 :text-to-video(abstract);video-language(abstract);分类 cs.CV

Comments CVPR 2024. Project page: https://zhaoyue-zephyrus.github.io/video-instruction-tuning

详情

展开后加载摘要…

URL PDF HTML 收藏
2305.08850 2024-02-20 cs.CV 70%

Make-A-Protagonist: Generic Video Editing with An Ensemble of Experts

Yuyang Zhao, Enze Xie, Lanqing Hong, Zhenguo Li, Gim Hee Lee

专题命中 视频生成 :video generation(abstract);video diffusion(abstract);分类 cs.CV

Comments Project page: https://make-a-protagonist.github.io

详情

展开后加载摘要…

URL PDF HTML 收藏
2311.03716 2023-11-08 cs.CL cs.AI cs.CV 70%

LLM as an Art Director (LaDi): Using LLMs to improve Text-to-Media Generators

Allen Roush, Emil Zakirov, Artemiy Shirokov, Polina Lunina, Jack Gane, Alexander Duffy, Charlie Basil, Aber Whitcomb, Jim Benedetto, Chris DeWolfe

专题命中 视频生成 :video generation(abstract);text-to-video(abstract);分类 cs.CV

Comments 12 pages, System Demonstration/Industry paper. Preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2305.09662 2023-05-17 cs.CV cs.AI 70%

Make-An-Animation: Large-Scale Text-conditional 3D Human Motion Generation

Samaneh Azadi, Akbar Shah, Thomas Hayes, Devi Parikh, Sonal Gupta

专题命中 视频生成 :video generation(abstract);text-to-video(abstract);分类 cs.CV

Comments arXiv admin note: text overlap with arXiv:2304.07410

详情

展开后加载摘要…

URL PDF HTML 收藏