arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

视频大模型

视频理解、视频生成、视频语言模型和时序视觉推理。

2026-02-11 至 2026-02-11 共收录 7 信号源:cs.CV, eess.IV, cs.MM

1. 视频扩散模型 7 篇

2504.16081 2026-02-11 cs.CV cs.CL 79%

Survey of Video Diffusion Models: Foundations, Implementations, and Applications

视频扩散模型综述:基础、实现与应用

Yimu Wang, Xuye Liu, Wei Pang, Li Ma, Shuai Yuan, Paul Debevec, Ning Yu

机构 * University of Waterloo(滑铁卢大学) Netflix Eyeline Studios Duke University(杜克大学)

专题命中 视频扩散模型 :video diffusion(title);video generation(abstract);分类 cs.CV

AI总结 本文综述视频扩散模型的基础、实现与应用,系统梳理了当前方法学体系,分析架构创新与优化策略,并探讨其在视频生成中的实际应用及与其他领域的协同作用。

Comments Accepted by TMLR

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.10102 2026-02-11 cs.CV 70%

VideoWorld 2: Learning Transferable Knowledge from Real-world Videos

VideoWorld 2: 从真实世界视频中学习可迁移的知识

Zhongwei Ren, Yunchao Wei, Xiao Yu, Guixun Luo, Yao Zhao, Bingyi Kang, Jiashi Feng, Xiaojie Jin

机构 * Beijing Jiaotong University(北京交通大学)

专题命中 视频扩散模型 :video generation(abstract);video diffusion(abstract);分类 cs.CV

AI总结 VideoWorld 2通过动态增强的潜在动态模型从真实世界视频中学习可迁移知识,显著提升了任务成功率和长周期推理能力。

Comments Code and models are released at: https://maverickren.github.io/VideoWorld2.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.09868 2026-02-11 cs.CV 70%

Free-GVC: Towards Training-Free Extreme Generative Video Compression with Temporal Coherence

Free-GVC: 向无训练极端生成视频压缩迈进:时间一致性

Xiaoyue Ling, Chuqin Zhou, Chunyi Li, Yunuo Chen, Yuan Tian, Guo Lu, Wenjun Zhang

机构 * Institute of Image Communication and Network Engineering, Shanghai Jiao Tong University(图像通信与网络工程研究所,上海交通大学) Shanghai AI Lab(上海人工智能实验室)

专题命中 视频扩散模型 :video generation(abstract);video diffusion(abstract);分类 cs.CV

AI总结 Free-GVC通过无训练的生成视频压缩框架,在超低比特率下实现视觉质量与时间一致性的提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.21091 2026-02-11 cs.CV 70%

ERTACache: Error Rectification and Timesteps Adjustment for Efficient Diffusion

ERTACache:误差修正与时间步调整以实现高效的扩散模型

Xurui Peng, Chenqian Yan, Hong Liu, Rui Ma, Fangmin Chen, Xing Wang, Zhihua Wu, Songwei Liu, Mingbao Lin

机构 * ByteDance Inc.(字节跳动公司) Rakuten Asia(乐天亚洲)

专题命中 视频扩散模型 :video generation(abstract);video diffusion(abstract);分类 cs.CV

AI总结 ERTACache通过误差修正和时间步调整,实现高效扩散模型的加速,保持视觉质量的同时提升推理效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.09883 2026-02-11 cs.CV 57%

AdaTSQ: Pushing the Pareto Frontier of Diffusion Transformers via Temporal-Sensitivity Quantization

AdaTSQ: 通过时间敏感量化推动扩散变换器的帕累托前沿

Shaoqiu Zhang, Zizhong Ding, Kaicheng Yang, Junyi Wu, Xianglong Yan, Xi Li, Bingnan Duan, Jianping Fang, Yulun Zhang

机构 * Shanghai Jiaotong University(上海交通大学)

专题命中 视频扩散模型 :video generation(abstract);分类 cs.CV

AI总结 AdaTSQ通过时间敏感量化方法提升扩散变换器的效率与质量,优于现有方法。

Comments Code will be released at https://github.com/Qiushao-E/AdaTSQ/

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.09268 2026-02-11 cs.CV 57%

Rethinking Global Text Conditioning in Diffusion Transformers

重新思考扩散变换器中的全局文本条件化

Nikita Starodubcev, Daniil Pakhomov, Zongze Wu, Ilya Drobyshevskiy, Yuchen Liu, Zhonghao Wang, Yuqian Zhou, Zhe Lin, Dmitry Baranchuk

机构 * Yandex Research(Yandex研究院) Adobe Research(Adobe研究院)

专题命中 视频扩散模型 :video generation(abstract);分类 cs.CV

AI总结 本文重新思考扩散变换器中的全局文本条件化,发现传统调制机制贡献有限,但通过不同视角使用池化嵌入可带来显著性能提升。

Comments Accepted at ICLR26

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.20240 2026-02-11 cs.CV 57%

Unconditional Priors Matter! Improving Conditional Generation of Fine-Tuned Diffusion Models

无条件先验很重要!改进细调扩散模型的条件生成

Prin Phunyaphibarn, Phillip Y. Lee, Jaihoon Kim, Minhyuk Sung

机构 * KAIST(韩国科学技术院)

专题命中 视频扩散模型 :video generation(abstract);分类 cs.CV

AI总结 本文提出通过替换无条件噪声提升条件生成质量,验证了使用其他扩散模型进行无条件噪声预测的有效性。

Comments WACV 2026; Project Page: https://unconditional-priors-matter.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏