arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

视频大模型

视频理解、视频生成、视频语言模型和时序视觉推理。

2026-01-01 至 2026-01-01 共收录 5 信号源:cs.CV, eess.IV, cs.MM

1. 视频生成 5 篇

2512.21776 2026-01-01 cs.CV cs.AI 83%

Inference-based GAN Video Generation

基于推断的GAN视频生成

Jingbo Yang, Adrian G. Bors

机构 * Department of Computer Science, University of York(计算机科学系,约克大学)

专题命中 视频生成 :video generation(title,abstract);long video(abstract);分类 cs.CV

AI总结 本文提出了一种基于对抗的VAE-GAN混合结构,通过马尔可夫链框架实现长视频生成,解决时序扩展难题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.24766 2026-01-01 cs.RO cs.AI cs.CV 79%

Dream2Flow: Bridging Video Generation and Open-World Manipulation with 3D Object Flow

Dream2Flow: 通过3D物体流连接视频生成与开放世界操控

Karthik Dharmarajan, Wenlong Huang, Jiajun Wu, Li Fei-Fei, Ruohan Zhang

专题命中 视频生成 :video generation(title,abstract);分类 cs.CV

AI总结 Dream2Flow通过3D物体流连接视频生成与开放世界操控,实现零样本操控不同类别的物体。

Comments Project website: https://dream2flow.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.24724 2026-01-01 cs.CV 74%

FlowBlending: Stage-Aware Multi-Model Sampling for Fast and High-Fidelity Video Generation

FlowBlending: 时序感知多模型采样用于快速且高保真的视频生成

Jibin Song, Mingi Kwon, Jaeseok Jeong, Youngjung Uh

机构 * Yonsei University(延世大学)

专题命中 视频生成 :video generation(title);分类 cs.CV

AI总结 FlowBlending通过时序感知的多模型采样策略,在保持视觉质量的同时,显著提升视频生成的推理速度和效率。

Comments Project page: https://jibin86.github.io/flowblending_project_page

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.24026 2026-01-01 cs.CV cs.AI 57%

PipeFlow: Pipelined Processing and Motion-Aware Frame Selection for Long-Form Video Editing

PipeFlow: 管道处理与运动感知帧选择用于长格式视频编辑

Mustafa Munir, Md Mostafijur Rahman, Kartikeya Bhardwaj, Paul Whatmough, Radu Marculescu

机构 * The University of Texas at Austin(德克萨斯大学奥斯汀分校) Qualcomm AI Research(高通人工智能研究)

专题命中 视频生成 :long video(abstract);分类 cs.CV

AI总结 PipeFlow通过运动感知帧选择和流水线任务调度,实现长格式视频编辑的高效处理,相比现有方法速度提升达9.6至31.7倍。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.20000 2026-01-01 cs.CV 57%

Few-Shot-Based Modular Image-to-Video Adapter for Diffusion Models

基于少样本的模块化图像到视频适配器用于扩散模型

Zhenhao Li, Shaohan Yi, Zheng Liu, Leonartinus Gao, Minh Ngoc Le, Ambrose Ling, Zhuoran Wang, Md Amirul Islam, Zhixiang Chi, Yuanhao Yu

机构 * Huawei Technologies Canada(华为加拿大技术有限公司) University of Waterloo(滑铁卢大学) University of British Columbia(不列颠哥伦比亚大学) University of Toronto(多伦多大学)

专题命中 视频生成 :video generation(abstract);分类 cs.CV

AI总结 本文提出MIVA,一种轻量级模块化适配器,用于在扩散模型中实现更精确的运动控制,同时保持或提升生成质量。

Comments GitHub page: https://github.com/yishaohan/MIVA

详情

展开后加载摘要…

URL PDF HTML 收藏