arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

视频大模型

视频理解、视频生成、视频语言模型和时序视觉推理。

共收录 6840 信号源:cs.CV, eess.IV, cs.MM

1. 视频生成 2171 篇

2310.07697 2024-05-24 cs.CV 88%

ConditionVideo: Training-Free Condition-Guided Text-to-Video Generation

Bo Peng, Xinyuan Chen, Yaohui Wang, Chaochao Lu, Yu Qiao

专题命中 视频生成 :video generation(title,abstract);text-to-video(title,abstract);分类 cs.CV

Comments AAAI 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2405.12796 2024-05-22 cs.CV 88%

DisenStudio: Customized Multi-subject Text-to-Video Generation with Disentangled Spatial Control

Hong Chen, Xin Wang, Yipeng Zhang, Yuwei Zhou, Zeyang Zhang, Siao Tang, Wenwu Zhu

专题命中 视频生成 :video generation(title,abstract);text-to-video(title,abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2405.08720 2024-05-15 cs.CV 88%

The Lost Melody: Empirical Observations on Text-to-Video Generation From A Storytelling Perspective

Andrew Shin, Yusuke Mori, Kunitake Kaneko

专题命中 视频生成 :video generation(title,abstract);text-to-video(title,abstract);分类 cs.CV

Comments To appear at CVPR 2024 Workshop on AI for Content Creation (AI4CC)

详情

展开后加载摘要…

URL PDF HTML 收藏
2404.18620 2024-04-30 cs.CV 88%

FlexiFilm: Long Video Generation with Flexible Conditions

Yichen Ouyang, jianhao Yuan, Hao Zhao, Gaoang Wang, Bo zhao

专题命中 视频生成 :video generation(title,abstract);long video(title,abstract);分类 cs.CV

Comments 9 pages, 9 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2311.12631 2024-04-24 cs.CV 88%

GPT4Motion: Scripting Physical Motions in Text-to-Video Generation via Blender-Oriented GPT Planning

Jiaxi Lv, Yi Huang, Mingfu Yan, Jiancheng Huang, Jianzhuang Liu, Yifan Liu, Yafei Wen, Xiaoxin Chen, Shifeng Chen

专题命中 视频生成 :video generation(title,abstract);text-to-video(title,abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2403.16407 2024-03-26 cs.CV 88%

A Survey on Long Video Generation: Challenges, Methods, and Prospects

Chengxuan Li, Di Huang, Zeyu Lu, Yang Xiao, Qingqi Pei, Lei Bai

专题命中 视频生成 :video generation(title,abstract);long video(title,abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2305.14330 2024-02-07 cs.CV cs.AI cs.CL 88%

DirecT2V: Large Language Models are Frame-Level Directors for Zero-Shot Text-to-Video Generation

Susung Hong, Junyoung Seo, Heeseong Shin, Sunghwan Hong, Seungryong Kim

专题命中 视频生成 :video generation(title,abstract);text-to-video(title,abstract);分类 cs.CV

Comments The code and demo will be available at https://github.com/KU-CVLAB/DirecT2V

详情

展开后加载摘要…

URL PDF HTML 收藏
2401.07781 2024-01-17 cs.CV 88%

Towards A Better Metric for Text-to-Video Generation

Jay Zhangjie Wu, Guian Fang, Haoning Wu, Xintao Wang, Yixiao Ge, Xiaodong Cun, David Junhao Zhang, Jia-Wei Liu, Yuchao Gu, Rui Zhao, Weisi Lin, Wynne Hsu, Ying Shan, Mike Zheng Shou

专题命中 视频生成 :video generation(title,abstract);text-to-video(title,abstract);分类 cs.CV

Comments Project page: https://showlab.github.io/T2VScore/

详情

展开后加载摘要…

URL PDF HTML 收藏
2401.00869 2024-01-03 cs.CV 88%

FlashVideo: A Framework for Swift Inference in Text-to-Video Generation

Bin Lei, le Chen, Caiwen Ding

专题命中 视频生成 :video generation(title,abstract);text-to-video(title,abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2308.08316 2024-01-02 cs.CV 88%

Dual-Stream Diffusion Net for Text-to-Video Generation

Binhui Liu, Xin Liu, Anbo Dai, Zhiyong Zeng, Dan Wang, Zhen Cui, Jian Yang

专题命中 视频生成 :video generation(title,abstract);text-to-video(title,abstract);分类 cs.CV

Comments 8pages, 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2311.18829 2024-01-01 cs.CV 88%

MicroCinema: A Divide-and-Conquer Approach for Text-to-Video Generation

Yanhui Wang, Jianmin Bao, Wenming Weng, Ruoyu Feng, Dacheng Yin, Tao Yang, Jingxu Zhang, Qi Dai Zhiyuan Zhao, Chunyu Wang, Kai Qiu, Yuhui Yuan, Chuanxin Tang, Xiaoyan Sun, Chong Luo, Baining Guo

专题命中 视频生成 :video generation(title,abstract);text-to-video(title,abstract);分类 cs.CV

Comments Project page: https://wangyanhui666.github.io/MicroCinema.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2312.15770 2023-12-27 cs.CV cs.AI 88%

A Recipe for Scaling up Text-to-Video Generation with Text-free Videos

Xiang Wang, Shiwei Zhang, Hangjie Yuan, Zhiwu Qing, Biao Gong, Yingya Zhang, Yujun Shen, Changxin Gao, Nong Sang

专题命中 视频生成 :video generation(title,abstract);text-to-video(title,abstract);分类 cs.CV

Comments Project page: https://tf-t2v.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2311.01813 2023-12-27 cs.CV 88%

FETV: A Benchmark for Fine-Grained Evaluation of Open-Domain Text-to-Video Generation

Yuanxin Liu, Lei Li, Shuhuai Ren, Rundong Gao, Shicheng Li, Sishuo Chen, Xu Sun, Lu Hou

专题命中 视频生成 :video generation(title,abstract);text-to-video(title,abstract);分类 cs.CV

Comments NeurIPS 2023 Datasets and Benchmarks Track

详情

展开后加载摘要…

URL PDF HTML 收藏
2312.04483 2023-12-08 cs.CV 88%

Hierarchical Spatio-temporal Decoupling for Text-to-Video Generation

Zhiwu Qing, Shiwei Zhang, Jiayu Wang, Xiang Wang, Yujie Wei, Yingya Zhang, Changxin Gao, Nong Sang

专题命中 视频生成 :video generation(title,abstract);text-to-video(title,abstract);分类 cs.CV

Comments Project page: https://higen-t2v.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2311.18834 2023-12-01 cs.CV 88%

ART$\boldsymbol{\cdot}$V: Auto-Regressive Text-to-Video Generation with Diffusion Models

Wenming Weng, Ruoyu Feng, Yanhui Wang, Qi Dai, Chunyu Wang, Dacheng Yin, Zhiyuan Zhao, Kai Qiu, Jianmin Bao, Yuhui Yuan, Chong Luo, Yueyi Zhang, Zhiwei Xiong

专题命中 视频生成 :video generation(title,abstract);text-to-video(title);long video(abstract);分类 cs.CV

Comments 24 pages, 21 figures. Project page at https://warranweng.github.io/art.v

详情

展开后加载摘要…

URL PDF HTML 收藏
2209.14792 2022-09-30 cs.CV cs.AI cs.LG 88%

Make-A-Video: Text-to-Video Generation without Text-Video Data

Uriel Singer, Adam Polyak, Thomas Hayes, Xi Yin, Jie An, Songyang Zhang, Qiyuan Hu, Harry Yang, Oron Ashual, Oran Gafni, Devi Parikh, Sonal Gupta, Yaniv Taigman

专题命中 视频生成 :video generation(title,abstract);text-to-video(title,abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2205.15868 2022-06-01 cs.CV cs.CL cs.LG 88%

CogVideo: Large-scale Pretraining for Text-to-Video Generation via Transformers

Wenyi Hong, Ming Ding, Wendi Zheng, Xinghan Liu, Jie Tang

专题命中 视频生成 :video generation(title,abstract);text-to-video(title,abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.02958 2026-05-05 cs.LG 88%

Quant VideoGen: Auto-Regressive Long Video Generation via 2-Bit KV-Cache Quantization

Quant VideoGen:通过2位KV缓存量化实现自回归长视频生成

Haocheng Xi, Shuo Yang, Yilong Zhao, Muyang Li, Han Cai, Xingyang Li, Yujun Lin, Zhuoyang Zhang, Jintao Zhang, Xiuyu Li, Zhiying Xu, Jun Wu, Chenfeng Xu, Ion Stoica, Song Han, Kurt Keutzer

机构 * University of California, Berkeley(加州大学伯克利分校) NVIDIA Massachusetts Institute of Technology(麻省理工学院) Amazon(亚马逊) The University of Texas at Austin(德克萨斯大学奥斯汀分校)

专题命中 视频生成 :video generation(title,abstract);long video(title);video diffusion(abstract)

AI总结 本文提出Quant VideoGen,通过语义感知平滑和渐进残差量化技术,有效降低KV缓存内存消耗,提升长视频生成质量与效率。

Comments Accepted by ICML 2026. 11 pages, 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.06812 2025-02-19 cs.LG cs.GR 88%

Harness Local Rewards for Global Benefits: Effective Text-to-Video Generation Alignment with Patch-level Reward Models

Shuting Wang, Haihong Tang, Zhicheng Dou, Chenyan Xiong

机构 * School of Computer Science, Carnegie Mellon University(卡内基梅隆大学计算机科学学院) Gaoling School of Artificial Intelligence, Renmin University of China(中国人民大学高瓴人工智能学院) Serendipity One Inc.(Serendipity One公司)

专题命中 视频生成 :video generation(title,abstract);text-to-video(title,abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2309.16429 2023-09-29 cs.LG cs.AI 88%

Diverse and Aligned Audio-to-Video Generation via Text-to-Video Model Adaptation

Guy Yariv, Itai Gat, Sagie Benaim, Lior Wolf, Idan Schwartz, Yossi Adi

专题命中 视频生成 :video generation(title,abstract);text-to-video(title,abstract)

Comments 9 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2304.08551 2023-09-29 cs.HC cs.AI 88%

Generative Disco: Text-to-Video Generation for Music Visualization

Vivian Liu, Tao Long, Nathan Raw, Lydia Chilton

专题命中 视频生成 :video generation(title,abstract);text-to-video(title,abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.16495 2024-12-30 cs.CV cs.MM 87%

Follow-Your-MultiPose: Tuning-Free Multi-Character Text-to-Video Generation via Pose Guidance

Beiyuan Zhang, Yue Ma, Chunlei Fu, Xinyang Song, Zhenan Sun, Ziqiang Li

机构 * School of Big Data and Software Engineering, Chongqing University(重庆大学大数据与软件学院) The Hong Kong University of Science and Technology(香港科技大学) School of Artificial Intelligence, University of Chinese Academy of Sciences(中国科学院大学人工智能学院) Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所) Shanghai Jiao Tong University(上海交通大学)

专题命中 视频生成 :video generation(title,abstract);text-to-video(title);分类 cs.CV、cs.MM

Comments 5 pages,conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.20749 2026-08-24 cs.CV 新提交 86%

Identity-Preserving Text-to-Video Generation via Agentic Enhancement and Semantic Repair

通过智能体增强与语义修复实现身份保留的文本到视频生成

Jiayi Gao, Changcheng Hua, Jiaqi Tang, Yuxin Peng, Yang Liu

机构 * Wangxuan Institute of Computer Technology, Peking University(北京大学王选计算机研究所)

专题命中 视频生成 :video generation(title,abstract);text-to-video(title);分类 cs.CV

AI总结 针对现有商业视频生成模型的身份漂移等缺陷,提出AESR轻量级框架,含智能体提示增强与视觉语义修复模块,搭配混合专家选择策略,其系统MIPL_Video在ACM MM 2026挑战赛赛道1获第一

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.03046 2026-08-05 cs.CV 新提交 86%

CAPE-T2V: Captioner-Anchored Prompt Enhancement toward Two-Sided Conditioning Alignment in Text-to-Video Generation

CAPE-T2V:面向文本到视频生成中双侧条件对齐的以字幕生成器为锚点的提示增强方法

Yizhuo Jia, Jingyun Hua, Yuanxing Zhang

专题命中 视频生成 :text-to-video(title,abstract);video generation(title);分类 cs.CV

AI总结 该研究针对文本到视频生成中存在的PE-字幕 gap,提出CAPE-T2V框架,通过两步微调PE与DiT,在多个基准数据集上实现了更高的生成综合得分,有效缩小了训练与推理间的条件不匹配。

Comments Includes appendix; 11 figures. Project page: https://github.com/yizzz927/CAPE-T2V

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.16947 2026-07-21 cs.CV 新提交 86%

When Physical Preferences Meet Semantic Constraints: Physical and Semantic Direct Preference Optimization for Text-to-Video Generation

当物理偏好遇到语义约束:用于文本到视频生成的物理和语义直接偏好优化

Siwei Meng, Yawei Luo, Shu Zhang, Ping Liu

机构 * University of Nevada, Reno(内华达大学雷诺分校) Zhejiang University(浙江大学)

专题命中 视频生成 :text-to-video(title,abstract);video generation(title);分类 cs.CV

AI总结 文本到视频生成模型存在物理合理性与语义一致性的矛盾,提出物理和语义直接偏好优化方法(PSDPO),通过调节偏好对贡献,限制语义漂移,实现更可靠平衡,实验验证其在提高物理合理性和保持语义一致性上优于基线和现有方法。

Comments This work is accepted by ACM MM 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.16716 2026-07-21 cs.CV cs.AI 版本更新 86%

When Cultures Move: Measuring and Improving Multicultural Text-to-Video Generation

MAVEN:面向多元文化文本到视频生成的多智能体框架

Shuowei Li, Yuming Zhao, Parth Bhalerao, Oana Ignat

机构 * Santa Clara University(圣克拉拉大学)

专题命中 视频生成 :text-to-video(title,abstract);video generation(title);分类 cs.CV

AI总结 提出MAVEN多智能体提示优化框架,通过并行或串行分解提示为人物、动作、地点维度,提升单文化和跨文化文本到视频生成的文化保真度,并构建包含243个文化提示和972个视频的基准进行评估。

Comments [14] pages, [6] figures, [11] tables, appendix included. Preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.30248 2026-07-16 cs.CV cs.LG 版本更新 86%

Your Data Manifold is Secretly a Reward Model: Shell-LCC for Text-to-Video Generation

你的数据流形实际上是一个奖励模型:Shell-LCC 用于文本到视频生成

Shihao Zhang, Yunzhi Li, Yuguang Yan, Junzhe Zhang, Wei Zhao, Bohan Wang, Hanwang Zhang

机构 * Huawei Central Research Institute(华为中央研究院) Guangdong University of Technology(广东技术大学)

专题命中 视频生成 :text-to-video(title,abstract);video generation(title);分类 cs.CV

AI总结 提出 Shell-LCC 方法,通过建模高质量 SFT 数据的流形结构,提供密集、可微且几乎零成本的奖励信号,以提升文本到视频生成质量,减少低层失真。

Comments ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.26058 2026-06-25 cs.CV 新提交 86%

DomainShuttle: Freeform Open Domain Subject-driven Text-to-video Generation

DomainShuttle: 自由形式开放域主题驱动文本到视频生成

Nan Chen, Yiyang Cai, Rongchang Xie, Junwen Pan, Cheng Chen, Weinan Jia, Zhuowei Chen, Wen Zhou, Zhenbang Sun, Wenhan Luo

机构 * Hong Kong University of Science and Technology(香港科技大学)

专题命中 视频生成 :text-to-video(title,abstract);video generation(title);分类 cs.CV

AI总结 提出DomainShuttle方法,通过Domain-MoT解耦视频与参考特征、Video-Reference DualRoPE实现精确主体空间建模及Cross-Pair Consistent Loss提取本质特征,在开放域视频个性化中同时实现高保真与生成灵活性。

Comments 19 pages, 9 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.25306 2026-06-25 cs.CV cs.AI 新提交 86%

Physics Question Scene Graph: Fine-grained Evaluation of Physical Plausibility in Text-to-Video Generation

物理问题场景图:文本到视频生成中物理合理性的细粒度评估

Atin Pothiraj, Jaemin Cho, Yue Zhang, Elias Stengel-Eskin, Mohit Bansal

机构 * University of North Carolina at Chapel Hill(北卡罗来纳大学教堂山分校) AI2(艾伦人工智能研究所) Johns Hopkins University(约翰霍普金斯大学) University of Texas at Austin(德克萨斯大学奥斯汀分校)

专题命中 视频生成 :video generation(title,abstract);text-to-video(title);分类 cs.CV

AI总结 提出物理问题场景图(PQSG),一种基于层次化问题的评估流程,通过图结构问题检查视频在对象、动作和物理规律上的忠实度,实现细粒度评估。

Comments ECCV 2026. Code and data: https://github.com/atinpothiraj/pqsg

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.24551 2026-06-23 cs.CV 版本更新 86%

PhyGDPO: Physics-Aware Groupwise Direct Preference Optimization for Physically Consistent Text-to-Video Generation

PhyGDPO: 物理感知的分组直接偏好优化以实现物理一致的文本到视频生成

Yuanhao Cai, Kunpeng Li, Menglin Jia, Jialiang Wang, Junzhe Sun, Feng Liang, Weifeng Chen, Felix Juefei-Xu, Chu Wang, Ali Thabet, Xiaoliang Dai, Xuan Ju, Alan Yuille, Ji Hou

机构 * Meta Superintelligence Labs(Meta超智能实验室) Johns Hopkins University(约翰霍普金斯大学) Meta BizAI(Meta商业人工智能)

专题命中 视频生成 :text-to-video(title,abstract);video generation(title);分类 cs.CV

AI总结 提出PhyAugPipe构建大规模物理增强数据集PhyVidGen-135K,并设计PhyGDPO框架,利用分组Plackett-Luce模型和物理引导奖励机制,实现物理一致的文本到视频生成。

Comments ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏