arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

视频大模型

视频理解、视频生成、视频语言模型和时序视觉推理。

2025-12-15 至 2025-12-15 共收录 6 信号源:cs.CV, eess.IV, cs.MM

1. 视频生成 6 篇

2512.05103 2025-12-15 cs.LG cs.AI cs.CL cs.CV 79%

TV2TV: A Unified Framework for Interleaved Language and Video Generation

TV2TV:一种用于交错语言和视频生成的统一框架

Xiaochuang Han, Youssef Emad, Melissa Hall, John Nguyen, Karthik Padthe, Liam Robbins, Amir Bar, Delong Chen, Michal Drozdzal, Maha Elbayad, Yushi Hu, Shang-Wen Li, Sreya Dutta Roy, Jakob Verbeek, XuDong Wang, Marjan Ghazvininejad, Luke Zettlemoyer, Emily Dinan

机构 * Meta FAIR

专题命中 视频生成 :video generation(title,abstract);分类 cs.CV

AI总结 TV2TV通过统一框架实现语言与视频生成的交错过程,提升视频生成的视觉质量和可控性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.24379 2025-12-15 cs.CV cs.AI 79%

Any2Caption:Interpreting Any Condition to Caption for Controllable Video Generation

Any2Caption:任何条件到字幕以实现可控视频生成

Shengqiong Wu, Weicai Ye, Jiahao Wang, Quande Liu, Xintao Wang, Pengfei Wan, Di Zhang, Kun Gai, Shuicheng Yan, Hao Fei, Tat-Seng Chua

机构 * Kuaishou Technology(快手科技) National University of Singapore(新加坡国立大学)

专题命中 视频生成 :video generation(title,abstract);分类 cs.CV

AI总结 Any2Caption通过多模态大语言模型实现任何条件到字幕的可控视频生成,提升视频生成的可控性和质量。

Comments Project Page: https://sqwu.top/Any2Cap/

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.05046 2025-12-15 cs.CV 74%

FlowDirector: Training-Free Flow Steering for Precise Text-to-Video Editing

FlowDirector: 无需训练的流引导文本到视频编辑

Guangzhao Li, Yanming Yang, Chenxi Song, Chi Zhang

机构 * AGI Lab, Westlake University(西湖大学AGI实验室) Central South University(中南大学) Shanghai Jiao Tong University(上海交通大学)

专题命中 视频生成 :text-to-video(title);分类 cs.CV

AI总结 FlowDirector通过直接在数据空间中建模编辑过程,无需训练和倒置步骤,实现了更精确的文本到视频编辑。

Comments Project Page is https://flowdirector-edit.github.io

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.11799 2025-12-15 cs.CV 57%

V-RGBX: Video Editing with Accurate Controls over Intrinsic Properties

V-RGBX:具有精确内在属性控制的视频编辑

Ye Fang, Tong Wu, Valentin Deschaintre, Duygu Ceylan, Iliyan Georgiev, Chun-Hao Paul Huang, Yiwei Hu, Xuelin Chen, Tuanfeng Yang Wang

机构 * Fudan University(复旦大学) Adobe Research(Adobe研究院) Stanford University(斯坦福大学)

专题命中 视频生成 :video generation(abstract);分类 cs.CV

AI总结 V-RGBX通过端到端框架实现基于内在属性的视频编辑,支持直观且物理合理的视频修改,适用于物体外观和场景重照明等应用。

Comments Project Page: https://aleafy.github.io/vrgbx

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.11293 2025-12-15 cs.CV 57%

Autoregressive Video Autoencoder with Decoupled Temporal and Spatial Context

具有解耦时间和空间上下文的自回归视频自编码器

Cuifeng Shen, Lumin Xu, Xingguo Zhu, Gengdai Liu

机构 * Zoom Communications(Zoom公司)

专题命中 视频生成 :video generation(abstract);分类 cs.CV

AI总结 ARVAE通过解耦时间和空间上下文,实现高效视频压缩与重建,具备轻量模型和小数据优势,适用于视频生成等下游任务。

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.01004 2025-12-15 cs.CV cs.AI 57%

MoCA-Video: Motion-Aware Concept Alignment for Consistent Video Editing

MoCA-Video:面向一致视频编辑的运动感知概念对齐

Tong Zhang, Juan C Leon Alcazar, Victor Escorcia, Bernard Ghanem

机构 * Department of Computer Science(计算机科学系) King Abdullah University of Science and Technology(国王阿卜杜勒阿齐兹大学科学与技术学院)

专题命中 视频生成 :video diffusion(abstract);分类 cs.CV

AI总结 MoCA-Video通过在冻结的视频扩散模型潜在空间中进行语义混合,实现无需训练的高质量视频编辑,通过动量修正和伽马残差模块提升时间稳定性和语义一致性。

详情

展开后加载摘要…

URL PDF HTML 收藏