Mechanisms of Multimodal Synchronization: Insights from Decoder-Based Video-Text-to-Speech Synthesis
多模态同步机制:来自基于解码器的视频-文本到语音合成的洞察
机构 * Apple(苹果公司)
AI总结 本文通过视频-文本到语音合成研究多模态同步机制,探讨了解码器如何整合不同模态信息,以及模态顺序对性能和迁移的影响,提出了TimeSync指标用于细粒度分析。
Comments 30 pages, Decoder-only model, Speech Synthesis