arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

视频大模型

视频理解、视频生成、视频语言模型和时序视觉推理。

共收录 6840 信号源:cs.CV, eess.IV, cs.MM

1. 视频生成 2171 篇

2510.26412 2026-05-29 cs.CV cs.AI 89%

LoCoT2V-Bench: Benchmarking Long-Form and Complex Text-to-Video Generation

LoCoT2V-Bench: 长文本与复杂文本到视频生成的基准测试

Xiangqing Zheng, Chengyue Wu, Kehai Chen, Min Zhang

机构 * Institute of Computing and Intelligence, Harbin Institute of Technology, Shenzhen, China(哈尔滨工业大学深圳研究院) The University of Hong Kong(香港大学)

专题命中 视频生成 :video generation(title,abstract);text-to-video(title,abstract);long video(abstract);分类 cs.CV

AI总结 针对长视频生成在复杂文本输入下的评估挑战,提出包含多场景提示与层次元数据的基准LoCoT2V-Bench,并设计多维度评估框架LoCoT2V-Eval,实验发现模型在细粒度文本-视频对齐和角色一致性方面存在显著不足。

Comments Accepted by ICML 2026 (Regular)

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.20910 2026-05-21 cs.CV 89%

FlowLong: Inference-time Long Video Generation via Manifold-constrained Tweedie Matching

FlowLong: 通过流形约束的 Tweedie 匹配实现推理时的长视频生成

Jangho Park, Geon Yeong Park, Gihyun Kwon, Jong Chul Ye

机构 * KAIST(韩国科学技术院) Amazon(亚马逊)

专题命中 视频生成 :video generation(title,abstract);long video(title,abstract);video diffusion(abstract);分类 cs.CV

AI总结 本文提出了一种新的推理时长视频生成方法,通过流形约束的Tweedie匹配在重叠滑动窗口中生成长视频,同时保持时间和空间一致性,并且无需额外训练。

Comments Project Page: https://flowlong-video.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.16649 2026-05-19 cs.CV 89%

AtlasVid: Efficient Ultra-High-Resolution Long Video Generation via Decoupled Global-Local Modeling

AtlasVid: 通过解耦的全局-局部建模实现高效超高清长视频生成

Ziyang Mai, Yuyao Zhang, Yu-Wing Tai

机构 * Dartmouth College(达特茅斯学院)

专题命中 视频生成 :video generation(title,abstract);long video(title,abstract);video diffusion(abstract);分类 cs.CV

AI总结 本文提出AtlasVid框架,通过解耦建模提升超高清长视频生成效率,实现60.9倍加速和更低训练成本,优于原生4K生成器。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.16003 2026-05-18 cs.CV 89%

Echo-Forcing: A Scene Memory Framework for Interactive Long Video Generation

回声驱动:一种用于交互式长视频生成的场景记忆框架

Mingqiang Wu, Weilun Feng, Zhefeng Zhang, Haotong Qin, Yuqi Li, Guoxin Fan, Xiaokun Liu, Zhulin An, Libo Huang, Yongjun Xu, Chuanguang Yang

机构 * State Key Laboratory of AI Safety, Institute of Computing Technology, Chinese Academy of Sciences, Beijing, China(中国科学院人工智能安全国家重点实验室,计算技术研究所,北京,中国) University of Chinese Academy of Sciences, Beijing, China(中国科学院大学,北京,中国) China University of Mining & Technology, Beijing(中国矿业大学(北京)) ETH Zürich(苏黎世联邦理工学院) City College of New York, City University of New York(纽约城市学院,纽约城市大学) Xiamen Institute of Data Intelligence, Xiamen, China(厦门数据智能研究院,厦门,中国)

专题命中 视频生成 :video generation(title,abstract);long video(title,abstract);video diffusion(abstract);分类 cs.CV

AI总结 本文提出Echo-Forcing框架,通过分层时间记忆、场景回溯帧和差分记忆衰减机制,解决长视频生成中历史KV状态的函数纠缠问题,实现交互式视频生成的流畅过渡与长距离场景回溯。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.06509 2026-05-08 cs.CV 89%

FreeSpec: Training-Free Long Video Generation via Singular-Spectrum Reconstruction

FreeSpec: 通过奇异谱重建实现无训练长视频生成

Fangda Chen, Shanshan Zhao, Longrong Yang, Chuanfu Xu, Zhigang Luo, Long Lan

机构 * College of Computer Science and Technology, National University of Defense Technology(国防科技大学计算机科学与技术学院) Alibaba International Digital Commerce(阿里巴巴国际数字商务) Zhejiang University(浙江大学) Xiangjiang Laboratory(湘江实验室)

专题命中 视频生成 :video generation(title,abstract);long video(title,abstract);video diffusion(abstract);分类 cs.CV

AI总结 FreeSpec通过奇异谱重建方法解决长视频生成中的内容漂移和时间不一致问题,利用低秩谱引导和高秩重建基,提升空间细节和时间动态的保留能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.04317 2025-11-07 cs.CV 89%

RISE-T2V: Rephrasing and Injecting Semantics with LLM for Expansive Text-to-Video Generation

Xiangjun Zhang, Litong Gong, Yinglin Zheng, Yansong Liu, Wentao Jiang, Mingyi Xu, Biao Wang, Tiezheng Ge, Ming Zeng

专题命中 视频生成 :video generation(title,abstract);text-to-video(title,abstract);video diffusion(abstract);分类 cs.CV

Comments 17 pages, 16 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.03997 2025-11-07 cs.CV 89%

PhysCorr: Dual-Reward DPO for Physics-Constrained Text-to-Video Generation with Automated Preference Selection

Peiyao Wang, Weining Wang, Qi Li

专题命中 视频生成 :video generation(title,abstract);text-to-video(title,abstract);video diffusion(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2401.09962 2025-10-29 cs.CV 89%

CustomVideo: Customizing Text-to-Video Generation with Multiple Subjects

Zhao Wang, Aoxue Li, Lingting Zhu, Yong Guo, Qi Dou, Zhenguo Li

机构 * Department of Computer Science and Engineering, The Chinese University of Hong Kong(计算机科学与工程系,香港中文大学) Huawei Noah Ark’s Lab(华为诺亚实验室) Department of Statistics and Actuarial Science, The University of Hong Kong(统计与精算系,香港大学)

专题命中 视频生成 :video generation(title,abstract);text-to-video(title,abstract);video diffusion(abstract);分类 cs.CV

Comments IEEE TMM 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2309.15818 2025-06-02 cs.CV 89%

Show-1: Marrying Pixel and Latent Diffusion Models for Text-to-Video Generation

David Junhao Zhang, Jay Zhangjie Wu, Jia-Wei Liu, Rui Zhao, Lingmin Ran, Yuchao Gu, Difei Gao, Mike Zheng Shou

专题命中 视频生成 :video generation(title,abstract);text-to-video(title,abstract);video diffusion(abstract);分类 cs.CV

Comments project page is https://showlab.github.io/Show-1

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.01172 2025-05-05 cs.CV 89%

FreePCA: Integrating Consistency Information across Long-short Frames in Training-free Long Video Generation via Principal Component Analysis

Jiangtong Tan, Hu Yu, Jie Huang, Jie Xiao, Feng Zhao

机构 * MoE Key Laboratory of Brain-inspired Intelligent Perception and Cognition, University of Science and Technology of China(脑启发智能感知与认知联合实验室,中国科学技术大学)

专题命中 视频生成 :video generation(title,abstract);long video(title,abstract);video diffusion(abstract);分类 cs.CV

Comments Accepted by CVPR 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.20502 2025-04-16 cs.CV 89%

ARLON: Boosting Diffusion Transformers with Autoregressive Models for Long Video Generation

Zongyi Li, Shujie Hu, Shujie Liu, Long Zhou, Jeongsoo Choi, Lingwei Meng, Xun Guo, Jinyu Li, Hefei Ling, Furu Wei

机构 * Huazhong University of Science and Technology(华中科技大学) The Chinese University of Hong Kong(香港中文大学) Microsoft Corporation(微软公司) KAIST(韩国科学技术院)

专题命中 视频生成 :video generation(title,abstract);long video(title,abstract);text-to-video(abstract);分类 cs.CV

Comments Accepted at ICLR2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.23796 2025-04-02 cs.CV 89%

On-device Sora: Enabling Training-Free Diffusion-based Text-to-Video Generation for Mobile Devices

Bosung Kim, Kyuhwan Lee, Isu Jeong, Jungmin Cheon, Yeojin Lee, Seulki Lee

专题命中 视频生成 :video generation(title,abstract);text-to-video(title,abstract);video diffusion(abstract);分类 cs.CV

Comments Replicated Submission. arXiv:2502.04363 submitted as second version of the paper

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.04363 2025-04-01 cs.CV 89%

On-device Sora: Enabling Training-Free Diffusion-based Text-to-Video Generation for Mobile Devices

Bosung Kim, Kyuhwan Lee, Isu Jeong, Jungmin Cheon, Yeojin Lee, Seulki Lee

机构 * Ulsan National Institute of Science and Technology(蔚山科学技术院)

专题命中 视频生成 :video generation(title,abstract);text-to-video(title,abstract);video diffusion(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.18150 2025-03-25 cs.CV 89%

LongDiff: Training-Free Long Video Generation in One Go

Zhuoling Li, Hossein Rahmani, Qiuhong Ke, Jun Liu

机构 * Lancaster University(兰卡斯特大学) Monash University(莫纳什大学)

专题命中 视频生成 :video generation(title,abstract);long video(title,abstract);video diffusion(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2407.02371 2025-02-14 cs.CV 89%

OpenVid-1M: A Large-Scale High-Quality Dataset for Text-to-video Generation

Kepan Nan, Rui Xie, Penghao Zhou, Tiehan Fan, Zhenheng Yang, Zhijie Chen, Xiang Li, Jian Yang, Ying Tai

机构 * Nanjing University(南京大学) ByteDance(字节跳动) Nankai University(南开大学)

专题命中 视频生成 :video generation(title,abstract);text-to-video(title,abstract);video diffusion(abstract);分类 cs.CV

Comments 20 pages, 15 figures, Published as a conference paper at ICLR 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.08639 2025-02-13 cs.CV 89%

CineMaster: A 3D-Aware and Controllable Framework for Cinematic Text-to-Video Generation

Qinghe Wang, Yawen Luo, Xiaoyu Shi, Xu Jia, Huchuan Lu, Tianfan Xue, Xintao Wang, Pengfei Wan, Di Zhang, Kun Gai

机构 * Dalian University of Technology(大连理工大学) The Chinese University of Hong Kong(香港中文大学) Kuaishou Technology(快手科技)

专题命中 视频生成 :video generation(title,abstract);text-to-video(title,abstract);video diffusion(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.07647 2025-01-15 cs.CV cs.AI 89%

BlobGEN-Vid: Compositional Text-to-Video Generation with Blob Video Representations

Weixi Feng, Chao Liu, Sifei Liu, William Yang Wang, Arash Vahdat, Weili Nie

机构 * UC Santa Barbara(加州大学圣巴巴拉分校) NVIDIA(英伟达公司)

专题命中 视频生成 :video generation(title,abstract);text-to-video(title,abstract);video diffusion(abstract);分类 cs.CV

Comments Project page: https://blobgen-vid2.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2406.02230 2024-10-04 cs.CV 89%

I4VGen: Image as Free Stepping Stone for Text-to-Video Generation

Xiefan Guo, Jinlin Liu, Miaomiao Cui, Liefeng Bo, Di Huang

专题命中 视频生成 :video generation(title,abstract);text-to-video(title,abstract);video diffusion(abstract);分类 cs.CV

Comments Project page: https://xiefan-guo.github.io/i4vgen

详情

展开后加载摘要…

URL PDF HTML 收藏
2407.19918 2024-07-30 cs.CV 89%

FreeLong: Training-Free Long Video Generation with SpectralBlend Temporal Attention

Yu Lu, Yuanzhi Liang, Linchao Zhu, Yi Yang

专题命中 视频生成 :video generation(title,abstract);long video(title,abstract);video diffusion(abstract);分类 cs.CV

Comments Project page: https://yulu.net.cn/freelong

详情

展开后加载摘要…

URL PDF HTML 收藏
2312.04086 2024-07-17 cs.CV 89%

MEVG: Multi-event Video Generation with Text-to-Video Models

Gyeongrok Oh, Jaehwan Jeong, Sieun Kim, Wonmin Byeon, Jinkyu Kim, Sungwoong Kim, Sangpil Kim

专题命中 视频生成 :video generation(title,abstract);text-to-video(title,abstract);video diffusion(abstract);分类 cs.CV

Comments Accepted by ECCV 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2305.13077 2023-05-23 cs.CV 89%

ControlVideo: Training-free Controllable Text-to-Video Generation

Yabo Zhang, Yuxiang Wei, Dongsheng Jiang, Xiaopeng Zhang, Wangmeng Zuo, Qi Tian

专题命中 视频生成 :video generation(title,abstract);text-to-video(title,abstract);long video(abstract);分类 cs.CV

Comments Code is available at https://github.com/YBYBZhang/ControlVideo

详情

展开后加载摘要…

URL PDF HTML 收藏
2304.08477 2023-04-19 cs.CV 89%

Latent-Shift: Latent Diffusion with Temporal Shift for Efficient Text-to-Video Generation

Jie An, Songyang Zhang, Harry Yang, Sonal Gupta, Jia-Bin Huang, Jiebo Luo, Xi Yin

专题命中 视频生成 :video generation(title,abstract);text-to-video(title,abstract);video diffusion(abstract);分类 cs.CV

Comments https://latent-shift.github.io

详情

展开后加载摘要…

URL PDF HTML 收藏
2403.05131 2026-01-22 cs.AI cs.CV 89%

Sora as a World Model? A Complete Survey on Text-to-Video Generation

Sora作为世界模型?文本到视频生成的全面调查

Fachrina Dewi Puspitasari, Chaoning Zhang, Joseph Cho, Adnan Haider, Noor Ul Eman, Omer Amin, Alexis Mankowski, Muhammad Umair, Jingyao Zheng, Sheng Zheng, Lik-Hang Lee, Caiyan Qin, Tae-Ho Kim, Choong Seon Hong, Yang Yang, Heng Tao Shen

机构 * University of Electronic Science and Technology of China(电子科技大学) Kyung Hee University(韩国庆熙大学) The Hong Kong Polytechnic University(香港理工大学) Harbin Institute of Technology Shenzhen(哈尔滨工业大学深圳学院) Nota Inc.(Nota公司) Tongji University(同济大学)

专题命中 视频生成 :video generation(title,abstract);text-to-video(title,abstract);分类 cs.CV

AI总结 本文全面调查了文本到视频生成技术在世界建模中的应用,指出其在空间、行动和战略智能方面的进展,但仍需解决多样性与一致性之间的权衡问题。

Comments First complete survey on Text-to-Video Generation from World Model perspective, 35 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2405.10674 2024-05-20 cs.CV cs.AI 89%

From Sora What We Can See: A Survey of Text-to-Video Generation

Rui Sun, Yumin Zhang, Tejal Shah, Jiahao Sun, Shuoying Zhang, Wenqi Li, Haoran Duan, Bo Wei, Rajiv Ranjan

专题命中 视频生成 :video generation(title,abstract);text-to-video(title,abstract);分类 cs.CV

Comments A comprehensive list of text-to-video generation studies in this survey is available at https://github.com/soraw-ai/Awesome-Text-to-Video-Generation

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.01942 2026-08-28 cs.CV cs.CL cs.MM 版本更新 88%

CultureVidBench: Benchmarking Cultural Understanding in Text-to-Video Generation

CultureVidBench:文本到视频生成中的文化理解基准测试

Xianjing Han, Yuhan Su, Yang Deng, Dong Ma, Wee Peng Tay, Bin Zhu

机构 * Nanyang Technological University(南洋理工大学) Centrale Supélec(中央高等电力学院) Singapore Management University(新加坡管理大学) University of Cambridge(剑桥大学)

专题命中 视频生成 :video generation(title,abstract);text-to-video(title,abstract);分类 cs.CV、cs.MM

AI总结 本研究推出CultureVidBench基准,评估7款T2V模型的文化理解能力,发现现有模型难捕捉细粒度文化细节,尤其针对代表性不足的文化区域与线索。

Comments EMNLP 2026 Main Conference, Project page:https://hanxjing.github.io/CultureVidBench/

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.03745 2026-03-30 cs.CV cs.AI cs.LG eess.IV 88%

StreamDiT: Real-Time Streaming Text-to-Video Generation

StreamDiT:实时流式文本到视频生成

Akio Kodaira, Tingbo Hou, Ji Hou, Markos Georgopoulos, Felix Juefei-Xu, Masayoshi Tomizuka, Yue Zhao

机构 * UC Berkeley(加州大学伯克利分校) Meta

专题命中 视频生成 :video generation(title,abstract);text-to-video(title,abstract);分类 cs.CV、eess.IV

AI总结 本文提出StreamDiT模型,通过流匹配和混合训练提升内容一致性和视觉质量,实现16FPS实时视频生成,支持流式生成等实时应用。

Comments CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.17440 2025-03-27 cs.CV cs.MM 88%

Identity-Preserving Text-to-Video Generation by Frequency Decomposition

Shenghai Yuan, Jinfa Huang, Xianyi He, Yunyuan Ge, Yujun Shi, Liuhan Chen, Jiebo Luo, Li Yuan

机构 * Peking University(北京大学) Peng Cheng Laboratory(鹏城实验室) University of Rochester(罗切斯特大学) Rabbitpre Intelligence(睿兔智算) National University of Singapore(新加坡国立大学)

专题命中 视频生成 :video generation(title,abstract);text-to-video(title,abstract);分类 cs.CV、cs.MM

Comments CVPR 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2311.10709 2024-08-06 cs.CV cs.AI cs.GR cs.LG cs.MM 88%

Emu Video: Factorizing Text-to-Video Generation by Explicit Image Conditioning

Rohit Girdhar, Mannat Singh, Andrew Brown, Quentin Duval, Samaneh Azadi, Sai Saketh Rambhatla, Akbar Shah, Xi Yin, Devi Parikh, Ishan Misra

专题命中 视频生成 :video generation(title,abstract);text-to-video(title,abstract);分类 cs.CV、cs.MM

Comments ECCV 2024. Project page: https://emu-video.metademolab.com

详情

展开后加载摘要…

URL PDF HTML 收藏
2311.13073 2023-12-21 cs.CV cs.LG cs.MM 88%

FusionFrames: Efficient Architectural Aspects for Text-to-Video Generation Pipeline

Vladimir Arkhipkin, Zein Shaheen, Viacheslav Vasilev, Elizaveta Dakhova, Andrey Kuznetsov, Denis Dimitrov

专题命中 视频生成 :video generation(title,abstract);text-to-video(title,abstract);分类 cs.CV、cs.MM

Comments Project page: https://ai-forever.github.io/kandinsky-video/

详情

展开后加载摘要…

URL PDF HTML 收藏
2309.03549 2023-09-08 cs.CV cs.AI cs.MM 88%

Reuse and Diffuse: Iterative Denoising for Text-to-Video Generation

Jiaxi Gu, Shicong Wang, Haoyu Zhao, Tianyi Lu, Xing Zhang, Zuxuan Wu, Songcen Xu, Wei Zhang, Yu-Gang Jiang, Hang Xu

专题命中 视频生成 :video generation(title,abstract);text-to-video(title,abstract);分类 cs.CV、cs.MM

详情

展开后加载摘要…

URL PDF HTML 收藏