arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

视频大模型

视频理解、视频生成、视频语言模型和时序视觉推理。

2025-12-16 至 2025-12-16 共收录 2 信号源:cs.CV, eess.IV, cs.MM

1. 长视频与时序推理 2 篇

2512.12430 2025-12-16 cs.CV 86%

Endless World: Real-Time 3D-Aware Long Video Generation

无限世界:实时3D感知长视频生成

Ke Zhang, Yiqun Mei, Jiacong Xu, Vishal M. Patel

机构 * Johns Hopkins University(约翰霍普金斯大学) Adobe Research(Adobe研究)

专题命中 长视频与时序推理 :video generation(title,abstract);long video(title);分类 cs.CV

AI总结 Endless World通过实时3D感知机制生成无限长且连贯的视频,解决长视频生成中的3D一致性与动态场景合成问题。

Comments 10 pages,7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.13604 2025-12-16 cs.CV 79%

LongVie 2: Multimodal Controllable Ultra-Long Video World Model

LongVie 2: 多模态可控超长视频世界模型

Jianxiong Gao, Zhaoxi Chen, Xian Liu, Junhao Zhuang, Chengming Xu, Jianfeng Feng, Yu Qiao, Yanwei Fu, Chenyang Si, Ziwei Liu

机构 * FDU(福建大学) NJU(南京大学) NTU(National University of Taiwan) NVIDIA(英伟达) THU(清华大学) Shanghai AI Laboratory(上海人工智能实验室)

专题命中 长视频与时序推理 :long video(title);video generation(abstract);分类 cs.CV

AI总结 LongVie 2通过多模态引导、退化感知训练和历史-上下文引导,实现了超长视频的可控生成,支持连续视频生成长达五分钟,推动视频世界建模的统一发展。

Comments Project Page: https://vchitect.github.io/LongVie2-project/

详情

展开后加载摘要…

URL PDF HTML 收藏