TV2TV: A Unified Framework for Interleaved Language and Video Generation
TV2TV:一种用于交错语言和视频生成的统一框架
机构 * Meta FAIR
专题命中 视频生成 :video generation(title,abstract);分类 cs.CV
AI总结 TV2TV通过统一框架实现语言与视频生成的交错过程,提升视频生成的视觉质量和可控性。
AI 大模型
视频理解、视频生成、视频语言模型和时序视觉推理。
TV2TV:一种用于交错语言和视频生成的统一框架
机构 * Meta FAIR
专题命中 视频生成 :video generation(title,abstract);分类 cs.CV
AI总结 TV2TV通过统一框架实现语言与视频生成的交错过程,提升视频生成的视觉质量和可控性。
Any2Caption:任何条件到字幕以实现可控视频生成
机构 * Kuaishou Technology(快手科技) ; National University of Singapore(新加坡国立大学)
专题命中 视频生成 :video generation(title,abstract);分类 cs.CV
AI总结 Any2Caption通过多模态大语言模型实现任何条件到字幕的可控视频生成,提升视频生成的可控性和质量。
Comments Project Page: https://sqwu.top/Any2Cap/
FlowDirector: 无需训练的流引导文本到视频编辑
机构 * AGI Lab, Westlake University(西湖大学AGI实验室) ; Central South University(中南大学) ; Shanghai Jiao Tong University(上海交通大学)
专题命中 视频生成 :text-to-video(title);分类 cs.CV
AI总结 FlowDirector通过直接在数据空间中建模编辑过程,无需训练和倒置步骤,实现了更精确的文本到视频编辑。
Comments Project Page is https://flowdirector-edit.github.io
V-RGBX:具有精确内在属性控制的视频编辑
机构 * Fudan University(复旦大学) ; Adobe Research(Adobe研究院) ; Stanford University(斯坦福大学)
专题命中 视频生成 :video generation(abstract);分类 cs.CV
AI总结 V-RGBX通过端到端框架实现基于内在属性的视频编辑,支持直观且物理合理的视频修改,适用于物体外观和场景重照明等应用。
Comments Project Page: https://aleafy.github.io/vrgbx
具有解耦时间和空间上下文的自回归视频自编码器
机构 * Zoom Communications(Zoom公司)
专题命中 视频生成 :video generation(abstract);分类 cs.CV
AI总结 ARVAE通过解耦时间和空间上下文,实现高效视频压缩与重建,具备轻量模型和小数据优势,适用于视频生成等下游任务。
MoCA-Video:面向一致视频编辑的运动感知概念对齐
机构 * Department of Computer Science(计算机科学系) ; King Abdullah University of Science and Technology(国王阿卜杜勒阿齐兹大学科学与技术学院)
专题命中 视频生成 :video diffusion(abstract);分类 cs.CV
AI总结 MoCA-Video通过在冻结的视频扩散模型潜在空间中进行语义混合,实现无需训练的高质量视频编辑,通过动量修正和伽马残差模块提升时间稳定性和语义一致性。
具有时间推理的上下文微调用于视频扩散模型的多功能控制
机构 * KAIST AI(韩国科学技术院人工智能研究中心)
专题命中 视频扩散模型 :video diffusion(title,abstract);video generation(abstract);text-to-video(abstract);分类 cs.CV
AI总结 TIC-FT通过时间推理实现视频扩散模型的多功能控制,无需架构修改,仅需少量样本即可实现高质量视频生成。
Comments project page: https://kinam0252.github.io/TIC-FT/
多主体视频动作迁移:通过视频扩散变换器实现
专题命中 视频扩散模型 :video diffusion(title);分类 cs.CV
AI总结 MultiMotion通过视频扩散变换器实现多主体视频动作迁移,引入AMF和RectPC提升动作解纠缠与生成效率,构建首个专用基准数据集。
FactorPortrait: 通过解耦的表情、姿态和视角实现可控的肖像动画
机构 * Meta Reality Labs(Meta现实实验室) ; Technical University of Munich(慕尼黑技术大学)
专题命中 视频扩散模型 :video diffusion(abstract);分类 cs.CV
AI总结 FactorPortrait通过解耦表情、姿态和视角实现可控肖像动画,利用预训练编码器和3D网格跟踪生成逼真动态效果。
Comments Project page: https://tangjiapeng.github.io/FactorPortrait/
FilmWeaver: 通过缓存引导自回归扩散编织一致的多镜头视频
机构 * Kling Team, Kuaishou Technology(快手科技 Kling Team)
专题命中 视频扩散模型 :video generation(abstract);分类 cs.CV
AI总结 FilmWeaver通过缓存引导自回归扩散模型实现多镜头视频的一致性生成,支持灵活交互和多任务应用。
Comments AAAI-2026
PersonaLive! 用于直播的 expressive 人物图像动画
机构 * University of Macau(澳门大学) ; GVC Lab, Great Bay University(大湾大学GVC实验室)
专题命中 视频扩散模型 :video generation(abstract);分类 cs.CV
AI总结 PersonaLive通过多阶段训练方法实现了实时面部动画生成,提升了效率和稳定性,达到7-22倍的速度提升。
VFMF:通过预测视觉基础模型特征进行世界建模
专题命中 视频扩散模型 :video generation(abstract);分类 cs.CV
AI总结 本文提出了一种基于VFM特征的生成预测器,通过自回归流匹配在潜在空间中实现更准确的预测,提升世界建模的效率和效果。
从跟踪中获取结构:从自回归视频跟踪模型中蒸馏保持结构的运动用于视频生成
机构 * HKUST(香港科技大学) ; University of Washington(华盛顿大学) ; Georgia Tech(佐治亚理工学院) ; Adobe(Adobe公司)
专题命中 动作与事件理解 :video generation(title);video diffusion(abstract);分类 cs.CV
AI总结 通过蒸馏自回归视频跟踪模型中的结构保持运动先验,SAM2VideoX在视频生成任务中实现了更高的保真度和一致性。
Comments Project Website: https://sam2videox.github.io/
高效动态查询动作计数
专题命中 动作与事件理解 :long video(abstract);分类 cs.CV
AI总结 本文提出了一种基于动态查询表示的高效动作计数方法,通过动态更新和跨查询对比学习,显著提升了长视频和未见过动作的计数性能。
Comments code: https://github.com/lizishi/DeTRC, proj page: https://shirleymaxx.github.io/DeTRC/