TV2TV: A Unified Framework for Interleaved Language and Video Generation
TV2TV:一种用于交错语言和视频生成的统一框架
机构 * Meta FAIR
专题命中 视频生成 :video generation(title,abstract);分类 cs.CV
AI总结 TV2TV通过统一框架实现语言与视频生成的交错过程,提升视频生成的视觉质量和可控性。
AI 大模型
视频理解、视频生成、视频语言模型和时序视觉推理。
TV2TV:一种用于交错语言和视频生成的统一框架
机构 * Meta FAIR
专题命中 视频生成 :video generation(title,abstract);分类 cs.CV
AI总结 TV2TV通过统一框架实现语言与视频生成的交错过程,提升视频生成的视觉质量和可控性。
Any2Caption:任何条件到字幕以实现可控视频生成
机构 * Kuaishou Technology(快手科技) ; National University of Singapore(新加坡国立大学)
专题命中 视频生成 :video generation(title,abstract);分类 cs.CV
AI总结 Any2Caption通过多模态大语言模型实现任何条件到字幕的可控视频生成,提升视频生成的可控性和质量。
Comments Project Page: https://sqwu.top/Any2Cap/
FlowDirector: 无需训练的流引导文本到视频编辑
机构 * AGI Lab, Westlake University(西湖大学AGI实验室) ; Central South University(中南大学) ; Shanghai Jiao Tong University(上海交通大学)
专题命中 视频生成 :text-to-video(title);分类 cs.CV
AI总结 FlowDirector通过直接在数据空间中建模编辑过程,无需训练和倒置步骤,实现了更精确的文本到视频编辑。
Comments Project Page is https://flowdirector-edit.github.io
V-RGBX:具有精确内在属性控制的视频编辑
机构 * Fudan University(复旦大学) ; Adobe Research(Adobe研究院) ; Stanford University(斯坦福大学)
专题命中 视频生成 :video generation(abstract);分类 cs.CV
AI总结 V-RGBX通过端到端框架实现基于内在属性的视频编辑,支持直观且物理合理的视频修改,适用于物体外观和场景重照明等应用。
Comments Project Page: https://aleafy.github.io/vrgbx
具有解耦时间和空间上下文的自回归视频自编码器
机构 * Zoom Communications(Zoom公司)
专题命中 视频生成 :video generation(abstract);分类 cs.CV
AI总结 ARVAE通过解耦时间和空间上下文,实现高效视频压缩与重建,具备轻量模型和小数据优势,适用于视频生成等下游任务。
MoCA-Video:面向一致视频编辑的运动感知概念对齐
机构 * Department of Computer Science(计算机科学系) ; King Abdullah University of Science and Technology(国王阿卜杜勒阿齐兹大学科学与技术学院)
专题命中 视频生成 :video diffusion(abstract);分类 cs.CV
AI总结 MoCA-Video通过在冻结的视频扩散模型潜在空间中进行语义混合,实现无需训练的高质量视频编辑,通过动量修正和伽马残差模块提升时间稳定性和语义一致性。