TurboT2VA: Fast Large-Scale Text-to-Video-Audio Generation via Score-Regularized Consistency Distillation
TurboT2VA:基于分数正则化一致性蒸馏的快速大规模文本-视频-音频生成
机构 * Zhejiang University(浙江大学) ; Tianjin University(天津大学) ; Tsinghua University(清华大学) ; Qingdao University(青岛大学) ; National University of Singapore(新加坡国立大学)
专题命中 视频生成 :text-to-video(title,abstract);分类 cs.CV
AI总结 本文提出TurboT2VA框架,通过多模态归一化与渐进式课程方案,在保持音视频生成质量的同时,大幅加速190亿参数联合T2VA模型的推理,在不同分辨率下实现最高54.67倍的生成器加速。