arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

视频大模型

视频理解、视频生成、视频语言模型和时序视觉推理。

2026-02-06 至 2026-02-06 共收录 4 信号源:cs.CV, eess.IV, cs.MM

1. 视频生成 4 篇

2602.06028 2026-02-06 cs.CV 83%

Context Forcing: Consistent Autoregressive Video Generation with Long Context

上下文强制:通过长上下文实现一致的自回归视频生成

Shuo Chen, Cong Wei, Sun Sun, Ping Nie, Kai Zhou, Ge Zhang, Ming-Hsuan Yang, Wenhu Chen

机构 * Department of EECS, University of California, Merced, USA(加州大学梅尔塞德斯分校电子工程与计算机科学系) University of Waterloo, Canada(滑铁卢大学)

专题命中 视频生成 :video generation(title,abstract);long video(abstract);分类 cs.CV

AI总结 Context Forcing通过长上下文教师训练学生,解决长视频生成中的学生-教师不匹配问题,实现更长的上下文长度和更一致的生成质量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.05966 2026-02-06 cs.CV cs.AI 79%

LSA: Localized Semantic Alignment for Enhancing Temporal Consistency in Traffic Video Generation

LSA:局部语义对齐用于增强交通视频生成中的时间一致性

Mirlan Karimov, Teodora Spasojevic, Markus Braun, Julian Wiederer, Vasileios Belagiannis, Marc Pollefeys

机构 * Mercedes-Benz AG(梅赛德斯-奔驰集团) ETH Zurich(苏黎世联邦理工学院) Friedrich-Alexander University Erlangen-Nuremberg(埃朗根-纽伦堡弗里德里希-亚历山大大学)

专题命中 视频生成 :video generation(title,abstract);分类 cs.CV

AI总结 LSA通过局部语义对齐提升交通视频生成的时间一致性,无需外部控制信号。

Comments Accepted to IEEE IV 2026. 8 pages, 3 figures. Code available at https://github.com/mirlanium/LSA

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.05827 2026-02-06 cs.CV cs.RO 79%

Sparse Video Generation Propels Real-World Beyond-the-View Vision-Language Navigation

稀疏视频生成推动现实世界超越视界视觉语言导航

Hai Zhang, Siqi Liang, Li Chen, Yuxian Li, Yukuan Xu, Yichao Zhong, Fu Zhang, Hongyang Li

专题命中 视频生成 :video generation(title,abstract);分类 cs.CV

AI总结 本文提出SparseVideoNav,通过稀疏视频生成实现现实世界超越视界导航,显著提升导航效率和成功率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.01758 2026-02-06 cs.CV 70%

Many-for-Many: Unify the Training of Multiple Video and Image Generation and Manipulation Tasks

许多对许多:统一多个视频和图像生成与操控任务的训练

Ruibin Li, Tao Yang, Yangming Shi, Weiguo Feng, Shilei Wen, Bingyue Peng, Lei Zhang

机构 * ByteDance(字节跳动) The Hong Kong Polytechnic University(香港理工大学)

专题命中 视频生成 :video generation(abstract);text-to-video(abstract);分类 cs.CV

AI总结 本文提出many-for-many框架,通过统一训练多个视频和图像生成与操控任务,提升视频生成性能并引入深度图条件。

详情

展开后加载摘要…

URL PDF HTML 收藏