arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

视频大模型

视频理解、视频生成、视频语言模型和时序视觉推理。

共收录 6840 信号源:cs.CV, eess.IV, cs.MM

1. 视频生成 2171 篇

2510.23007 2025-10-28 cs.CV 88%

CoMo: Compositional Motion Customization for Text-to-Video Generation

Youcan Xu, Zhen Wang, Jiaxin Shi, Kexin Li, Feifei Shao, Jun Xiao, Yi Yang, Jun Yu, Long Chen

机构 * Zhejiang University(浙江大学) HKUST(香港科技大学) Xmax.AI Ltd(Xmax人工智能有限公司) HIT (SZ)(哈尔滨工业大学(深圳))

专题命中 视频生成 :video generation(title,abstract);text-to-video(title,abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.18692 2025-10-22 cs.CV 88%

MoGA: Mixture-of-Groups Attention for End-to-End Long Video Generation

Weinan Jia, Yuning Lu, Mengqi Huang, Hualiang Wang, Binyuan Huang, Nan Chen, Mu Liu, Jidong Jiang, Zhendong Mao

机构 * University of Science and Technology of China(科学技术大学) Hong Kong University of Science and Technology(香港科学与技术大学) Wuhan University(武汉大学)

专题命中 视频生成 :video generation(title,abstract);long video(title,abstract);分类 cs.CV

Comments 15 pages, 12 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.03334 2025-10-15 cs.CV 88%

Macro-from-Micro Planning for High-Quality and Parallelized Autoregressive Long Video Generation

Xunzhi Xiang, Yabo Chen, Guiyu Zhang, Zhongyu Wang, Zhe Gao, Quanming Xiang, Gonghu Shang, Junqi Liu, Haibin Huang, Yang Gao, Chi Zhang, Qi Fan, Xuelong Li

机构 * Nanjing University(南京大学) Institute of Artificial Intelligence, China Telecom (TeleAI)(中国电信人工智能研究院) Shanghai Jiao Tong University(上海交通大学) Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳)) University of Chinese Academy of Sciences(中国科学院大学)

专题命中 视频生成 :video generation(title,abstract);long video(title,abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.00329 2025-09-24 cs.LG cs.AI cs.CV 88%

Foresight: Adaptive Layer Reuse for Accelerated and High-Quality Text-to-Video Generation

Muhammad Adnan, Nithesh Kurella, Akhil Arunkumar, Prashant J. Nair

机构 * The University of British Columbia(不列颠哥伦比亚大学) d-Matrix

专题命中 视频生成 :video generation(title,abstract);text-to-video(title,abstract);分类 cs.CV

Comments Accepted at the 39th Conference on Neural Information Processing Systems (NeurIPS), 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.16956 2025-09-23 cs.CV 88%

VidCLearn: A Continual Learning Approach for Text-to-Video Generation

Luca Zanchetta, Lorenzo Papa, Luca Maiano, Irene Amerini

机构 * Sapienza University of Rome, Italy(罗马大学萨皮恩扎) ESA philab(欧洲航天局实验室)

专题命中 视频生成 :video generation(title,abstract);text-to-video(title,abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.20491 2025-09-03 cs.CV cs.CL cs.LG 88%

VPO: Aligning Text-to-Video Generation Models with Prompt Optimization

Jiale Cheng, Ruiliang Lyu, Xiaotao Gu, Xiao Liu, Jiazheng Xu, Yida Lu, Jiayan Teng, Zhuoyi Yang, Yuxiao Dong, Jie Tang, Hongning Wang, Minlie Huang

机构 * The Conversational Artificial Intelligence (CoAI) Group, Tsinghua University(清华大学对话人工智能(CoAI)小组) Zhipu AI(智谱AI) The Knowledge Engineering Group (KEG), Tsinghua University(清华大学知识工程小组(KEG))

专题命中 视频生成 :video generation(title,abstract);text-to-video(title,abstract);分类 cs.CV

Comments ICCV 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.03034 2025-08-14 cs.CV 88%

MoCA: Identity-Preserving Text-to-Video Generation via Mixture of Cross Attention

Qi Xie, Yongjia Ma, Donglin Di, Xuehao Gao, Xun Yang

机构 * University of Science and Technology of China(中国科学技术大学) Li Auto(利汽车) Northwestern Polytechnical University(西北工业大学)

专题命中 视频生成 :text-to-video(title,abstract);video generation(title);video diffusion(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.18688 2025-08-06 cs.CV cs.AI 88%

Video Is Worth a Thousand Images: Exploring the Latest Trends in Long Video Generation

Faraz Waseem, Muhammad Shahzad

机构 * University Of Reading(阅读大学)

专题命中 视频生成 :video generation(title,abstract);long video(title,abstract);分类 cs.CV

Comments 35 pages, 18 figures, Manuscript submitted to ACM

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.12952 2025-07-18 cs.CV 88%

LoViC: Efficient Long Video Generation with Context Compression

Jiaxiu Jiang, Wenbo Li, Jingjing Ren, Yuping Qiu, Yong Guo, Xiaogang Xu, Han Wu, Wangmeng Zuo

专题命中 视频生成 :video generation(title,abstract);long video(title);text-to-video(abstract);分类 cs.CV

Comments Project page: https://jiangjiaxiu.github.io/lovic/

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.00162 2025-07-02 cs.CV 88%

FreeLong++: Training-Free Long Video Generation via Multi-band SpectralFusion

Yu Lu, Yi Yang

机构 * ReLER, CCAI, Zhejiang University(ReLER、CCAI、浙江大学)

专题命中 视频生成 :video generation(title,abstract);long video(title,abstract);分类 cs.CV

Comments under review

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.00337 2025-05-02 cs.LG cs.AI cs.CL cs.CV 88%

T2VPhysBench: A First-Principles Benchmark for Physical Consistency in Text-to-Video Generation

Xuyang Guo, Jiayan Huo, Zhenmei Shi, Zhao Song, Jiahao Zhang, Jiale Zhao

机构 * Guilin University of Electronic Technology(桂林电子科技大学) University of Arizona(亚利桑那大学) University of Wisconsin-Madison(威斯康星大学麦迪逊分校) The Simons Institute for the Theory of Computing at the UC, Berkeley(伯克利大学计算机理论学院Simon研究所) Arizona State University(亚利桑那州立大学)

专题命中 视频生成 :video generation(title,abstract);text-to-video(title,abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.15032 2025-05-01 cs.CV 88%

DyST-XL: Dynamic Layout Planning and Content Control for Compositional Text-to-Video Generation

Weijie He, Mushui Liu, Yunlong Yu, Zhao Wang, Chao Wu

机构 * Zhejiang University(浙江大学)

专题命中 视频生成 :video generation(title,abstract);text-to-video(title,abstract);分类 cs.CV

Comments 9 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2311.00990 2025-04-15 cs.CV 88%

VideoDreamer: Customized Multi-Subject Text-to-Video Generation with Disen-Mix Finetuning on Language-Video Foundation Models

Hong Chen, Xin Wang, Guanning Zeng, Yipeng Zhang, Yuwei Zhou, Feilin Han, Yaofei Wu, Wenwu Zhu

机构 * Tsinghua University(清华大学) Beijing National Research Center for Information Science and Technology(北京信息科学与技术国家研究中心) Beijing Film Academy(北京电影学院) Beijing University of Technology(北京工业大学)

专题命中 视频生成 :video generation(title,abstract);text-to-video(title,abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.06861 2025-04-10 cs.CV cs.AI 88%

EIDT-V: Exploiting Intersections in Diffusion Trajectories for Model-Agnostic, Zero-Shot, Training-Free Text-to-Video Generation

Diljeet Jagpal, Xi Chen, Vinay P. Namboodiri

机构 * University of Bath(巴斯大学) Fudan University(复旦大学)

专题命中 视频生成 :video generation(title,abstract);text-to-video(title,abstract);分类 cs.CV

Comments Accepted at IEEE/CVF Conference on Computer Vision and Pattern Recognition (CVPR) 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.00596 2025-04-02 cs.CV cs.AI 88%

PhyT2V: LLM-Guided Iterative Self-Refinement for Physics-Grounded Text-to-Video Generation

Qiyao Xue, Xiangyu Yin, Boyuan Yang, Wei Gao

机构 * University of Pittsburgh(匹兹堡大学)

专题命中 视频生成 :video generation(title,abstract);text-to-video(title,abstract);分类 cs.CV

Comments 28 pages

Journal ref in Proceedings of the IEEE/CVF Conference on Computer Vision and Pattern Recognition (CVPR), 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.11513 2025-03-17 cs.CV cs.AI 88%

HiTVideo: Hierarchical Tokenizers for Enhancing Text-to-Video Generation with Autoregressive Large Language Models

Ziqin Zhou, Yifan Yang, Yuqing Yang, Tianyu He, Houwen Peng, Kai Qiu, Qi Dai, Lili Qiu, Chong Luo, Lingqiao Liu

机构 * The University of Adelaide(阿德莱德大学) Microsoft Research Asia(微软亚洲研究院)

专题命中 视频生成 :video generation(title,abstract);text-to-video(title,abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2404.02101 2025-03-17 cs.CV 88%

CameraCtrl: Enabling Camera Control for Text-to-Video Generation

Hao He, Yinghao Xu, Yuwei Guo, Gordon Wetzstein, Bo Dai, Hongsheng Li, Ceyuan Yang

机构 * The Chinese University of Hong Kong(香港中文大学) Shanghai Artificial Intelligence Laboratory(上海人工智能实验室) Stanford University(斯坦福大学)

专题命中 视频生成 :video generation(title,abstract);text-to-video(title);video diffusion(abstract);分类 cs.CV

Comments Project page: https://hehao13.github.io/projects-CameraCtrl/ Code: https://github.com/hehao13/CameraCtrl

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.11234 2025-03-13 cs.CV 88%

MaskFlow: Discrete Flows For Flexible and Efficient Long Video Generation

Michael Fuest, Vincent Tao Hu, Björn Ommer

机构 * LMU Munich(慕尼黑大学) MCML(慕尼黑计算与机器学习实验室)

专题命中 视频生成 :video generation(title,abstract);long video(title,abstract);分类 cs.CV

Comments Project page: https://compvis.github.io/maskflow/

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.06241 2025-02-28 cs.CV 88%

ByTheWay: Boost Your Text-to-Video Generation Model to Higher Quality in a Training-free Way

Jiazi Bu, Pengyang Ling, Pan Zhang, Tong Wu, Xiaoyi Dong, Yuhang Zang, Yuhang Cao, Dahua Lin, Jiaqi Wang

机构 * SJTU(上海交通大学) USTC(中国科学技术大学) CUHK(香港中文大学) Shanghai AI Laboratory(上海人工智能实验室)

专题命中 视频生成 :video generation(title,abstract);text-to-video(title,abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2407.14505 2025-01-16 cs.CV 88%

T2V-CompBench: A Comprehensive Benchmark for Compositional Text-to-video Generation

Kaiyue Sun, Kaiyi Huang, Xian Liu, Yue Wu, Zihan Xu, Zhenguo Li, Xihui Liu

机构 * The University of Hong Kong(香港大学) The Chinese University of Hong Kong(香港中文大学) Huawei Noah’s Ark Lab(华为诺亚方舟实验室)

专题命中 视频生成 :video generation(title,abstract);text-to-video(title,abstract);分类 cs.CV

Comments Project page: https://t2v-compbench-2025.github.io/ Code: https://github.com/KaiyueSun98/T2V-CompBench/tree/V2

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.01987 2025-01-13 cs.CV cs.AI cs.CY cs.LG 88%

Gender Bias in Text-to-Video Generation Models: A case study of Sora

Mohammad Nadeem, Shahab Saquib Sohail, Erik Cambria, Björn W. Schuller, Amir Hussain

专题命中 视频生成 :video generation(title,abstract);text-to-video(title,abstract);分类 cs.CV

Comments 7 pages, 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2404.00234 2024-12-31 cs.CV 88%

Grid Diffusion Models for Text-to-Video Generation

Taegyeong Lee, Soyeong Kwon, Taehwan Kim

专题命中 视频生成 :video generation(title,abstract);text-to-video(title,abstract);分类 cs.CV

Comments This paper is being withdrawn due to issues of misconduct in the experiments presented in Table 1 and 5. We recognize this as an ethical concern and sincerely apologize to the research community for any inconvenience it may have caused

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.09283 2024-12-13 cs.CV cs.AI 88%

InstanceCap: Improving Text-to-Video Generation via Instance-aware Structured Caption

Tiehan Fan, Kepan Nan, Rui Xie, Penghao Zhou, Zhenheng Yang, Chaoyou Fu, Xiang Li, Jian Yang, Ying Tai

专题命中 视频生成 :video generation(title,abstract);text-to-video(title,abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.04440 2024-12-06 cs.CV 88%

GenMAC: Compositional Text-to-Video Generation with Multi-Agent Collaboration

Kaiyi Huang, Yukun Huang, Xuefei Ning, Zinan Lin, Yu Wang, Xihui Liu

专题命中 视频生成 :video generation(title,abstract);text-to-video(title,abstract);分类 cs.CV

Comments Project website: https://karine-h.github.io/GenMAC/

详情

展开后加载摘要…

URL PDF HTML 收藏
2406.04277 2024-10-15 cs.CV 88%

VideoTetris: Towards Compositional Text-to-Video Generation

Ye Tian, Ling Yang, Haotian Yang, Yuan Gao, Yufan Deng, Jingmin Chen, Xintao Wang, Zhaochen Yu, Xin Tao, Pengfei Wan, Di Zhang, Bin Cui

专题命中 视频生成 :video generation(title,abstract);text-to-video(title,abstract);分类 cs.CV

Comments NeurIPS 2024. Code: https://github.com/YangLing0818/VideoTetris

详情

展开后加载摘要…

URL PDF HTML 收藏
2312.00330 2024-09-13 cs.CV cs.AI 88%

StyleCrafter: Enhancing Stylized Text-to-Video Generation with Style Adapter

Gongye Liu, Menghan Xia, Yong Zhang, Haoxin Chen, Jinbo Xing, Yibo Wang, Xintao Wang, Yujiu Yang, Ying Shan

专题命中 视频生成 :video generation(title,abstract);text-to-video(title,abstract);分类 cs.CV

Comments SIGGRAPH Asia 2024 (Journal Track). Project: https://gongyeliu.github.io/StyleCrafter.github.io/ ; GitHub: https://github.com/GongyeLiu/StyleCrafter

详情

展开后加载摘要…

URL PDF HTML 收藏
2408.11788 2024-08-22 cs.AI cs.CL cs.CV cs.SE 88%

DreamFactory: Pioneering Multi-Scene Long Video Generation with a Multi-Agent Framework

Zhifei Xie, Daniel Tang, Dingwei Tan, Jacques Klein, Tegawend F. Bissyand, Saad Ezzini

专题命中 视频生成 :video generation(title,abstract);long video(title,abstract);分类 cs.CV

Comments 13 pages, 8 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2408.02629 2024-08-06 cs.CV 88%

VidGen-1M: A Large-Scale Dataset for Text-to-video Generation

Zhiyu Tan, Xiaomeng Yang, Luozheng Qin, Hao Li

专题命中 视频生成 :video generation(title,abstract);text-to-video(title,abstract);分类 cs.CV

Comments project page: https://sais-fuxi.github.io/projects/vidgen-1m

详情

展开后加载摘要…

URL PDF HTML 收藏
2407.01921 2024-07-08 cs.CV 88%

GVDIFF: Grounded Text-to-Video Generation with Diffusion Models

Huanzhang Dou, Ruixiang Li, Wei Su, Xi Li

专题命中 视频生成 :video generation(title,abstract);text-to-video(title,abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2311.00949 2024-06-11 cs.CV 88%

POS: A Prompts Optimization Suite for Augmenting Text-to-Video Generation

Shijie Ma, Huayi Xu, Mengjian Li, Weidong Geng, Yaxiong Wang, Meng Wang

专题命中 视频生成 :video generation(title,abstract);text-to-video(title,abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏