Taming Text-to-Sounding Video Generation via Advanced Modality Condition and Interaction
通过高级模态条件与交互驯服文本到发声视频生成
机构 * Renmin University of China(中国人民大学) ; Apple(苹果公司)
AI总结 提出分层视觉基础字幕框架(HVGC)生成解耦的视频和音频字幕,并基于此引入双塔扩散变换器BridgeDiT,通过双交叉注意力机制实现对称双向信息交互,在三个基准数据集上达到最先进结果。
Comments The 19th European Conference on Computer Vision -- ECCV 2026