Precise Video-to-Audio Generation with Cross-Modal Alignment in Latent Space
在潜在空间中通过跨模态对齐实现精确的视频到音频生成
机构 * FPT Software AI Center(FPT软件人工智能中心) ; NVIDIA Corporation(NVIDIA公司)
AI总结 研究视频到音频生成问题,提出Flowley架构,结合视觉特征与文本提示,通过渐进软掩码交叉注意力实现视听同步,无额外计算成本,还提出SoundCap字幕,该方法在多个指标及零样本音频质量上达先进水平。
Comments Accepted to ECCV 2026