arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

视频大模型

视频理解、视频生成、视频语言模型和时序视觉推理。

共收录 6840 信号源:cs.CV, eess.IV, cs.MM

1. 视频生成 2171 篇

2309.00398 2023-09-08 cs.CV cs.MM 88%

VideoGen: A Reference-Guided Latent Diffusion Approach for High Definition Text-to-Video Generation

Xin Li, Wenqing Chu, Ye Wu, Weihang Yuan, Fanglong Liu, Qi Zhang, Fu Li, Haocheng Feng, Errui Ding, Jingdong Wang

专题命中 视频生成 :video generation(title,abstract);text-to-video(title,abstract);分类 cs.CV、cs.MM

Comments 8pages, 8figures, project page: https://videogen.github.io/VideoGen/

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.26671 2026-08-28 cs.CV 新提交 88%

RECAP-Forcing: Retaining Content Appearances for Long Video Generation

RECAP-Forcing:保留内容外观以实现长视频生成

Haiyang Xu, Zheng Ding, Zhuowen Tu

机构 * UC San Diego(加州大学圣迭戈分校)

专题命中 视频生成 :video generation(title,abstract);long video(title,abstract);分类 cs.CV

AI总结 针对长自回归视频生成的内存挑战,提出按外观新颖性组织内存的RECAP-Forcing方法,通过注意力汇和光流新颖性库统一机制,免训练且无额外参数,提升视频质量与语义保真度,优于现有内存方法。

Comments Project page: https://xxuhaiyang.github.io/RECAP-Forcing/

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.24289 2026-08-25 cs.CV cs.LG 版本更新 88%

Mode Seeking meets Mean Seeking for Fast Long Video Generation

模式寻求与均值寻求的结合用于快速长视频生成

Shengqu Cai, Weili Nie, Chao Liu, Julius Berner, Lvmin Zhang, Nanye Ma, Hansheng Chen, Maneesh Agrawala, Leonidas Guibas, Gordon Wetzstein, Arash Vahdat

机构 * Stanford University, California, USA(斯坦福大学) NVIDIA Research, California, USA(NVIDIA研究)

专题命中 视频生成 :video generation(title,abstract);long video(title,abstract);分类 cs.CV

AI总结 本文提出一种结合模式寻求与均值寻求的解耦扩散变换器,通过监督学习生成快速长视频,提升长距离连贯性和局部真实感。

Comments Project website: https://primecai.github.io/mmm/

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.16513 2026-08-18 cs.CV cs.AI 新提交 88%

MLLM-Guided Semantic Correction for Text-to-Video Generation

基于多模态大语言模型(MLLM)的文本到视频生成语义修正

Junhao Chen, Zheqi Lv, Keting Yin, Shengyu Zhang, Zhou Zhao, Feiyang Chen, Xinyu Duan, Baoxing Huai, Fei Wu

机构 * Zhejiang University(浙江大学) Huawei Cloud Computing Technology Co., Ltd.(华为云计算技术有限公司)

专题命中 视频生成 :video generation(title,abstract);text-to-video(title,abstract);分类 cs.CV

AI总结 该研究提出一种无需训练的MLLM引导文本到视频生成语义修正框架,通过两个关键模块在生成中修正语义偏差,提升了生成内容的语义对齐度等性能,经多基准实验验证有效。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.26694 2026-08-18 cs.CV 版本更新 88%

Visko Orbis 1.0: A Live Model for Real-Time Interactive Long Video Generation

Visko Orbis 1.0:用于实时交互式长视频生成的实时模型

Xiangbo Gao, Siyuan Yang, Ping He, Mingyang Wu, Yuheng Wu, Yushen Zuo, Jiongze Yu, Ryan Cui, Hongyuan Hua, Devin Ma, Xiao Jin, Yubo Yuan, Qing Yin, Jie Yang, Zhengzhong Tu

专题命中 视频生成 :video generation(title,abstract);long video(title);text-to-video(abstract);分类 cs.CV

AI总结 Visko Orbis 1.0是一款实时交互式长视频生成模型,支持多类型生成任务与实时提示词切换,靠有界多尺度记忆实现长视频生成无明显漂移,在对比测试中获最优偏好与稳定性评分。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.27110 2026-08-04 cs.CV 版本更新 88%

FreqForcing: Autoregressive Long Video Generation via Spectral Self-Anchoring

FreqForcing:基于频谱自锚定的自回归长视频生成方法

Jiatong Li, Leo Liang, Linghe Kong, Yulun Zhang

专题命中 视频生成 :video generation(title,abstract);long video(title);video diffusion(abstract);分类 cs.CV

AI总结 本文针对自回归长视频生成中的误差累积问题,提出无需训练的FreqForcing框架,通过频谱自锚定技术实现24倍外推,性能优于现有无训练方法且与有训练方法有竞争力。

Comments Code is available at: https://github.com/jiatongli2024/FreqForcing

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.21028 2026-08-03 cs.CV cs.AI 版本更新 88%

DySink: Dynamic Frame Sinks for Autoregressive Long Video Generation

DySink:动态帧 sinks 用于自回归长视频生成

Bo Ye, Xinyu Cui, Jian Zhao, Tong Wei, Min-Ling Zhang

机构 * School of Computer Science and Engineering, Southeast University(东南大学计算机科学与工程学院) Key Lab. of Computer Network and Information Integration, Southeast University(东南大学计算机网络与信息集成重点实验室) Zhongguancun Academy(中关村学院) Zhongguancun Institute of Artificial Intelligence(中关村人工智能研究院) Institute of Automation, CAS(中国科学院自动化研究所)

专题命中 视频生成 :video generation(title,abstract);long video(title,abstract);分类 cs.CV

AI总结 本文提出 DySink,一种基于检索的框架,通过维护紧凑的记忆银行并选择视觉相关的历史帧作为动态帧 sinks,以提高自回归长视频生成的动态性和时间质量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.21027 2026-07-24 cs.CV 新提交 88%

GroupVideo: Multi-Identity Customized Text-to-Video Generation

GroupVideo:多身份定制文本到视频生成

Xinyang Song, Libin Wang, Jianxin Sun, Qi Li, Dandan Zheng, JingDong Chen, Zhenan Sun

机构 * University of Chinese Academy of Sciences(中国科学院大学) Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所) Ant Group(蚂蚁集团)

专题命中 视频生成 :video generation(title,abstract);text-to-video(title);video diffusion(abstract);分类 cs.CV

AI总结 研究多身份定制文本到视频生成问题,提出GroupVideo框架,融合多模态身份对齐及相关模块,构建高质量数据集,在生成多角色视频时能保持身份一致且动作自然,优于现有方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.17279 2026-07-21 cs.CR cs.AI cs.MM 新提交 88%

Between Safe Boundaries: Exploiting Temporal Consistency for Jailbreaking Text-To-Video Generation Models

在安全边界之间:利用时间一致性破解文本到视频生成模型

Xingkai Peng, Jun Jiang, Jiayang Liu, Kejiang Chen, Weiming Zhang

机构 * University of Science and Technology of China(科学技术大学)

专题命中 视频生成 :video generation(title,abstract);text-to-video(title,abstract);分类 cs.MM

AI总结 研究针对文本到视频模型的越狱攻击,提出结构化查询高效的BSB框架,利用时间一致性,通过在文本代理空间进行蒙特卡洛树搜索并结合视频级评估来校准结果,实验表明该方法超越现有基线,有效发现模型漏洞。

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.10915 2026-07-13 cs.CV cs.AI cs.LG 版本更新 88%

M4V: Multimodal Mamba for Efficient Text-to-Video Generation

M4V:用于高效文本到视频生成的多模态曼巴

Jiancheng Huang, Gengwei Zhang, Zequn Jie, Siyu Jiao, Yinlong Qian, Ling Chen, Yunchao Wei, Lin Ma

机构 * Meituan(美团) University of Technology Sydney(技术大学悉尼分校) Beijing Jiaotong University(北京交通大学)

专题命中 视频生成 :video generation(title,abstract);text-to-video(title,abstract);分类 cs.CV

AI总结 研究针对文本到视频生成计算量大的问题,引入多模态曼巴框架M4V。设计MM-DiM块,采用多模态令牌重新组合设计,增强时空一致性。实验表明,该框架能在降计算成本的同时生成高质量视频。

Comments CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.22370 2026-06-23 cs.CV 新提交 88%

Towards Error-Free Long Video Generation

迈向无错误的长视频生成

Shuning Chang, Weihua Chen, Jiasheng Tang, Hao Xu, Zeyu Zhang, Hangjie Yuan, Yu Lu, Ruigang Niu, Fan Wang, Bohan Zhuang, Yi Yang

机构 * Zhejiang University(浙江大学) Alibaba Group(阿里巴巴集团)

专题命中 视频生成 :video generation(title,abstract);long video(title,abstract);分类 cs.CV

AI总结 提出一种基于扩散模型的长视频生成框架,通过因果注意力、KV缓存和截断修正流技术解决误差累积和属性漂移问题,实现高质量、身份一致的单镜头长视频合成。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.22973 2026-06-23 cs.CV 版本更新 88%

BIFE: Better Interaction, Fewer Errors for Minute-Long Video Generation

BIFE:更好的交互,更少的错误,用于分钟级视频生成

Zeyu Zhang, Jinyuan Mao, Shuning Chang, Yuanyu He, Yizeng Han, Jiasheng Tang, Fan Wang, Bohan Zhuang

机构 * DAMO Academy, Alibaba Group(阿里巴巴集团 DAMO 院) Zhejiang University(浙江大学) Hupan Lab(虎扑实验室)

专题命中 视频生成 :video generation(title,abstract);long video(title,abstract);分类 cs.CV

AI总结 提出BIFE框架,通过语义稀疏KV缓存和块强制训练策略,解决长视频生成中的长程交互保持和误差累积问题,实现稳定连贯的分钟级视频生成,在VDE指标上提升约20%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.11969 2026-06-11 cs.CV 新提交 88%

SpecLoR: Spectral Lookahead Rectification for Motion-Coherent Text-to-Video Generation

SpecLoR: 面向运动连贯文本到视频生成的频谱前瞻矫正

Xu Zhang, Yu Lu, Ruijie Quan, Zhaozheng Chen, Bohan Wang, Yi Yang

机构 * ReLER, College of Artificial Intelligence, Zhejiang University(浙江大学人工智能学院ReLER实验室) Huawei Central Research Institute(华为中央研究院)

专题命中 视频生成 :video generation(title,abstract);text-to-video(title,abstract);分类 cs.CV

AI总结 提出SpecLoR,一种即插即用的推理方法,通过前瞻预测和频域矫正减少文本到视频生成中的时空不一致性,在Wan2.2上显著提升运动连贯性且仅增加4次NFE。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.08091 2026-06-09 cs.CV 新提交 88%

VideoWeaver: Evaluating and Evolving Skills for Agentic Long Video Generation

VideoWeaver: 评估与进化智能体长视频生成技能

Jianhui Wei, Jie Tan, Hengchuan Zhu, Xiaotian Zhang, Yan Zhang, Ziyi Chen, Daoan Zhang, Wei Xu, Zuozhu Liu

机构 * Zhejiang University(浙江大学) ByteDance(字节跳动)

专题命中 视频生成 :video generation(title,abstract);long video(title,abstract);分类 cs.CV

AI总结 提出VideoWeaver框架,让智能体自主组合基础技能生成视频,并设计智能体裁判评估过程与结果,通过技能进化算法提升生成质量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.02441 2026-06-02 cs.CV 88%

Spatial-Temporal Decoupled Reference Conditioning for Identity-Preserving Text-to-Video Generation

空间-时间解耦参考条件用于身份保持的文本到视频生成

Yuheng Chen, Teng Hu, Yuji Wang, Qingdong He, Lizhuang Ma, Jiangning Zhang

机构 * Shanghai Jiao Tong University(上海交通大学) University of Electronic Science and Technology of China(电子科技大学) Zhejiang University(浙江大学)

专题命中 视频生成 :video generation(title,abstract);text-to-video(title,abstract);分类 cs.CV

AI总结 提出ST-DRC框架,通过空间-时间解耦参考条件、TASS-RoPE机制和身份目标,实现高保真身份保持视频生成。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.30519 2026-06-01 cs.CV 88%

OmniMem: Scalable and Adaptive Memory Retrieval for Long Video Generation

OmniMem: 用于长视频生成的可扩展自适应记忆检索

Lin Zhao, Yushu Wu, Yifan Gong, Yanzhi Wang, Pu Zhao

机构 * Northeastern University(东北大学) Adobe Research

专题命中 视频生成 :video generation(title,abstract);long video(title,abstract);分类 cs.CV

AI总结 提出OmniMem框架,通过自适应窗口排除和查询共享KV选择等机制,在自回归视频生成中实现显式全范围稀疏KV检索,显著提升长视频动态程度并保持一致性。

Comments 22 pages, 14 figures; project page: https://wuyushuwys.github.io/OmniMem/

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.18739 2026-05-20 cs.CV cs.DC 88%

LongLive-2.0: An NVFP4 Parallel Infrastructure for Long Video Generation

LongLive-2.0: 一个基于NVFP4的长视频生成并行基础设施

Yukang Chen, Luozhou Wang, Wei Huang, Shuai Yang, Bohan Zhang, Yicheng Xiao, Ruihang Chu, Weian Mao, Qixin Hu, Shaoteng Liu, Yuyang Zhao, Huizi Mao, Ying-Cong Chen, Enze Xie, Xiaojuan Qi, Song Han

机构 * NVIDIA

专题命中 视频生成 :video generation(title,abstract);long video(title,abstract);分类 cs.CV

AI总结 本文提出LongLive-2.0,一个基于NVFP4的并行基础设施,用于长视频生成的整个训练和推理流程,解决了速度和内存瓶颈问题。通过引入序列并行自回归训练方法,结合NVFP4精度,显著降低了GPU内存消耗并加速了训练过程。同时,该系统能够将扩散模型转换为长视频生成的自回归扩散模型,并在不同GPU架构上实现了高效的推理和训练。

Comments Code, model, and demos are available at https://github.com/NVlabs/LongLive

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.20206 2026-05-15 cs.CV 88%

RAPO++: Cross-Stage Prompt Optimization for Text-to-Video Generation via Data Alignment and Test-Time Scaling

RAPO++: 通过数据对齐和测试时缩放实现文本到视频生成的跨阶段提示优化

Bingjie Gao, Qianli Ma, Xiaoxue Wu, Shuai Yang, Guanzhou Lan, Haonan Zhao, Jiaxuan Chen, Qingyang Liu, Yu Qiao, Xinyuan Chen, Yaohui Wang, Li Niu

机构 * Shanghai Jiao Tong University(上海交通大学) Shanghai Artificial Intelligence Laboratory(上海人工智能实验室)

专题命中 视频生成 :video generation(title,abstract);text-to-video(title,abstract);分类 cs.CV

AI总结 RAPO++通过数据对齐和测试时缩放,结合训练数据对齐、测试时迭代缩放和大语言模型微调,提升文本到视频生成效果,无需修改生成基础模型。

Comments arXiv admin note: text overlap with arXiv:2504.11739

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.13111 2026-05-14 cs.CV 88%

Pyramid Forcing: Head-Aware Pyramid KV Cache Policy for High-Quality Long Video Generation

金字塔强制:面向高质量长视频生成的头部感知金字塔KV缓存策略

Jiayu Chen, Junbei Tang, Wenbiao Zhao, Maoliang Li, Jiayi Luo, Zihao Zheng, Jiawei Yang, Guojie Luo, Xiang Chen

机构 * Peking University(北京大学) South China University of Technology(华南理工大学) Xinjiang University(新疆大学) Beihang University(北京航空航天大学) Zhongguancun Academy(中关村学院)

专题命中 视频生成 :video generation(title,abstract);long video(title,abstract);分类 cs.CV

AI总结 本文提出Pyramid Forcing,通过识别不同头部类型并分配特定缓存策略,提升长视频生成质量,实验显示在VBench-Long上Self Forcing得分提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.09442 2026-05-12 cs.CV cs.AI 88%

SWIFT: Prompt-Adaptive Memory for Efficient Interactive Long Video Generation

SWIFT: 用于高效交互长视频生成的提示自适应内存

Shanwen Tan, Hao Li, Jingtao Zhang, Xiaosong Jia, Xue Yang, Shaofeng Zhang, Yanyong Zhang

机构 * University of Science and Technology of China(中国科学技术大学) Fudan University(复旦大学) Georgia Institute of Technology(佐治亚理工学院) Shanghai Jiao Tong University(上海交通大学)

专题命中 视频生成 :video generation(title,abstract);long video(title);video diffusion(abstract);分类 cs.CV

AI总结 SWIFT提出一种无需训练的多提示长视频生成框架,通过轻量级语义注入缓存和自适应动态窗口实现高效语义切换,保持时间一致性,达到22.6 FPS的高效生成速度。

Comments Code is available at https://github.com/ShanwenTan/SWIFT

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.08735 2026-05-12 cs.CV 88%

CollabVR: Collaborative Video Reasoning with Vision-Language and Video Generation Models

CollabVR: 基于视觉-语言和视频生成模型的协作视频推理

Joowon Kim, Seungho Shin, Joonhyung Park, Eunho Yang

机构 * KAIST(韩国科学技术院) Kyung Hee University(庆熙大学) AITRICS

专题命中 视频生成 :video generation(title,abstract);video reasoning(title,abstract);分类 cs.CV

AI总结 CollabVR通过结合视觉-语言模型与视频生成模型,在步骤级实现协作视频推理,提升多步任务性能,并在基准测试中优于现有方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.11698 2026-04-20 cs.CV cs.AI cs.CL 88%

OSCBench: Benchmarking Object State Change in Text-to-Video Generation

OSCBench:文本到视频生成中对象状态变化的基准测试

Xianjing Han, Bin Zhu, Shiqi Hu, Franklin Mingzhe Li, Patrick Carrington, Roger Zimmermann, Jingjing Chen

机构 * National University of Singapore(新加坡国立大学) Singapore Management University(新加坡管理大学) Carnegie Mellon University(卡内基梅隆大学) Fudan University(复旦大学)

专题命中 视频生成 :video generation(title,abstract);text-to-video(title,abstract);分类 cs.CV

AI总结 本文提出OSCBench基准,用于评估文本到视频模型在对象状态变化上的性能,揭示当前模型在处理新场景时的不足。

Comments ACL 2026 Main Conference, Project page: https://hanxjing.github.io/OSCBench

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.17844 2026-04-09 cs.CV cs.AI 88%

Less is More: Data-Efficient Adaptation for Controllable Text-to-Video Generation

少即是多:可控文本到视频生成的数据高效适应

Shihan Cheng, Nilesh Kulkarni, David Hyde, Dmitriy Smirnov

机构 * Vanderbilt University, USA(美国范德堡大学) Netflix, USA(美国Netflix)

专题命中 视频生成 :text-to-video(title,abstract);video generation(title);video diffusion(abstract);分类 cs.CV

AI总结 本文提出一种数据高效微调策略,通过稀疏低质量合成数据学习物理摄像参数控制,证明其优于真实数据微调结果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.17180 2026-04-06 cs.CV cs.AI 88%

We'll Fix it in Post: Improving Text-to-Video Generation with Neuro-Symbolic Feedback

事后修复:通过神经符号反馈改进文本到视频生成

Minkyu Choi, S P Sharan, Harsh Goel, Sahil Shah, Sandeep Chinchali

机构 * The University of Texas at Austin(德克萨斯大学奥斯汀分校)

专题命中 视频生成 :video generation(title,abstract);text-to-video(title,abstract);分类 cs.CV

AI总结 本文提出NeuS-E框架,通过神经符号反馈提升文本到视频生成的语义和时间一致性,实验显示其在多种提示下提升了40%的对齐度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.21309 2026-03-31 cs.CV 88%

NewtonGen: Physics-Consistent and Controllable Text-to-Video Generation via Neural Newtonian Dynamics

NewtonGen: 通过神经牛顿动力学实现物理一致且可控的文本到视频生成

Yu Yuan, Xijun Wang, Tharindu Wickremasinghe, Zeeshan Nadir, Bole Ma, Stanley H. Chan

机构 * Purdue University(普渡大学) Samsung Research America(三星美国研究院)

专题命中 视频生成 :video generation(title,abstract);text-to-video(title,abstract);分类 cs.CV

AI总结 本文提出NewtonGen框架,结合数据驱动合成与可学习物理原理,通过可训练的神经牛顿动力学模型实现物理一致的视频生成,并提供精确的参数控制。

Comments Accepted by ICLR 2026. Camera-ready version. Project Page: https://yuyuanspace.com/NewtonGen/

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.01509 2026-03-03 cs.CV cs.AI 88%

Retrieval, Refinement, and Ranking for Text-to-Video Generation via Prompt Optimization and Test-Time Scaling

通过提示优化和测试时扩展实现文本到视频生成的检索、细化与排序

Zillur Rahman, Alex Sheng, Cristian Meo

机构 * Algoverse AI

专题命中 视频生成 :video generation(title,abstract);text-to-video(title,abstract);分类 cs.CV

AI总结 本文提出3R框架,通过提示优化和测试时扩展提升文本到视频生成的准确性与效率。

Comments 2026 ICLR TTU Workshop

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.07328 2025-12-09 cs.CV cs.AI 88%

ContextAnyone: Context-Aware Diffusion for Character-Consistent Text-to-Video Generation

ContextAnyone: 基于上下文的扩散模型用于一致的文本到视频生成

Ziyang Mai, Yu-Wing Tai

机构 * Dartmouth College(达特茅斯学院)

专题命中 视频生成 :video generation(title,abstract);text-to-video(title,abstract);分类 cs.CV

AI总结 ContextAnyone通过上下文感知扩散模型实现从文本和参考图像生成一致的角色视频,结合双引导损失和Gap-RoPE位置嵌入提升视觉质量和身份一致性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.12578 2025-12-03 cs.CV 88%

TempoMaster: Efficient Long Video Generation via Next-Frame-Rate Prediction

TempoMaster: 通过下一帧速率预测实现高效的长视频生成

Yukuo Ma, Cong Liu, Junke Wang, Junqi Liu, Haibin Huang, Zuxuan Wu, Chi Zhang, Xuelong Li

机构 * Fudan University(复旦大学) Institute of Artificial Intelligence (TeleAI), China Telecom(人工智能研究所(TeleAI),中国电信)

专题命中 视频生成 :video generation(title,abstract);long video(title,abstract);分类 cs.CV

AI总结 TempoMaster通过下一帧速率预测实现高效长视频生成,结合双向注意力和自回归机制,提升视觉和时间质量。

Comments for more information, see https://scottykma.github.io/tempomaster-gitpage/

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.21129 2025-11-27 cs.CV cs.GR 88%

CtrlVDiff: Controllable Video Generation via Unified Multimodal Video Diffusion

通过统一多模态视频扩散实现可控视频生成

Dianbing Xi, Jiepeng Wang, Yuanzhi Liang, Xi Qiu, Jialun Liu, Hao Pan, Yuchi Huo, Rui Wang, Haibin Huang, Chi Zhang, Xuelong Li

机构 * State Key Laboratory of CAD&CG(计算机辅助设计与图形学国家重点实验室) Institute of Artificial Intelligence, China Telecom (TeleAI)(中国电信人工智能研究院) Tsinghua University(清华大学)

专题命中 视频生成 :video generation(title,abstract);video diffusion(title);video understanding(abstract);分类 cs.CV

AI总结 CtrlVDiff通过统一多模态视频扩散模型,实现可控视频生成,支持多模态输入并提升生成的可控性和保真度。

Comments 27 pages, 18 figures, 9 tables. Project page: https://tele-ai.github.io/CtrlVDiff/

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.24134 2025-10-31 cs.CV cs.AI cs.CL 88%

VC4VG: Optimizing Video Captions for Text-to-Video Generation

Yang Du, Zhuoran Lin, Kaiqiang Song, Biao Wang, Zhicheng Zheng, Tiezheng Ge, Bo Zheng, Qin Jin

机构 * School of Information, Renmin University of China(中国人民大学信息学院) Taobao & Tmall Group of Alibaba(阿里巴巴淘宝与天猫集团)

专题命中 视频生成 :video generation(title,abstract);text-to-video(title,abstract);分类 cs.CV

Comments Accepted by EMNLP 2025

详情

展开后加载摘要…

URL PDF HTML 收藏