arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

视频大模型

视频理解、视频生成、视频语言模型和时序视觉推理。

2025-12-12 至 2025-12-12 共收录 5 信号源:cs.CV, eess.IV, cs.MM

1. 视频生成 5 篇

2511.00090 2025-12-12 cs.CV cs.AI 83%

LeMiCa: Lexicographic Minimax Path Caching for Efficient Diffusion-Based Video Generation

LeMiCa:基于词典极小极大路径缓存的高效扩散式视频生成

Huanlin Gao, Ping Chen, Fuyuan Shi, Chao Tan, Zhaoxiang Liu, Fang Zhao, Kai Wang, Shiguo Lian

机构 * Data Science & Artificial Intelligence Research Institute, China Unicom(数据科学与人工智能研究院,中国联合电信) Unicom Data Intelligence, China Unicom(中国联合电信数据智能中心)

专题命中 视频生成 :video generation(title,abstract);text-to-video(abstract);分类 cs.CV

AI总结 LeMiCa通过词典极小极大路径优化策略,提升扩散式视频生成的推理速度与生成质量,实现高效且高质量的视频合成。

Comments NeurIPS 2025 Spotlight

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.10943 2025-12-12 cs.CV cs.AI 79%

AlcheMinT: Fine-grained Temporal Control for Multi-Reference Consistent Video Generation

AlcheMinT:多参考一致视频生成的细粒度时间控制

Sharath Girish, Viacheslav Ivanov, Tsai-Shien Chen, Hao Chen, Aliaksandr Siarohin, Sergey Tulyakov

机构 * Snap Inc. UC Merced(加州大学默塞德分校)

专题命中 视频生成 :video generation(title,abstract);分类 cs.CV

AI总结 AlcheMinT通过引入显式时间戳条件化,实现了多主体视频生成中的细粒度时间控制,提升了视频生成的精确性和保真度。

Comments Project page: https://snap-research.github.io/Video-AlcheMinT/snap-research.github.io/Video-AlcheMinT

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.10286 2025-12-12 cs.CV 79%

ShotDirector: Directorially Controllable Multi-Shot Video Generation with Cinematographic Transitions

ShotDirector: 电影化可控多镜头视频生成

Xiaoxue Wu, Xinyuan Chen, Yaohui Wang, Yu Qiao

机构 * Fudan University(复旦大学) Shanghai Artificial Intelligence Laboratory(上海人工智能实验室)

专题命中 视频生成 :video generation(title,abstract);分类 cs.CV

AI总结 ShotDirector通过整合参数级相机控制和分层编辑模式感知提示,实现了电影化可控的多镜头视频生成。

Comments Project Page: https://uknowsth.github.io/ShotDirector/

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.09363 2025-12-12 cs.CV 79%

StereoWorld: Geometry-Aware Monocular-to-Stereo Video Generation

StereoWorld: 一种基于几何的单目到立体视频生成方法

Ke Xing, Xiaojie Jin, Longfei Li, Yuyang Yin, Hanwen Liang, Guixun Luo, Chen Fang, Jue Wang, Konstantinos N. Plataniotis, Yao Zhao, Yunchao Wei

机构 * Beijing Jiaotong University(北京交通大学) Dzine AI University of Toronto(多伦多大学)

专题命中 视频生成 :video generation(title,abstract);分类 cs.CV

AI总结 StereoWorld通过几何感知正则化和时空拼接方案,实现高效高质量的单目到立体视频生成。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.03040 2025-12-12 cs.CV cs.AI 79%

Video4Spatial: Towards Visuospatial Intelligence with Context-Guided Video Generation

Video4Spatial: 通过基于场景的视频生成实现视觉空间智能

Zeqi Xiao, Yiwei Zhao, Lingxiao Li, Yushi Lan, Ning Yu, Rahul Garg, Roshni Cooper, Mohammad H. Taghavi, Xingang Pan

机构 * Netflix Nanyang Technological University(南洋理工大学) University of Oxford(牛津大学) Eyeline Studios

专题命中 视频生成 :video generation(title);video diffusion(abstract);分类 cs.CV

AI总结 Video4Spatial通过仅使用视频数据训练的生成模型,实现了复杂空间任务的视觉空间智能,展示了视频生成模型在空间推理中的潜力。

Comments Project page at https://xizaoqu.github.io/video4spatial/

详情

展开后加载摘要…

URL PDF HTML 收藏