M3-TTS: Multi-modal DiT Alignment & Mel-latent for Zero-shot High-fidelity Speech Synthesis
M3-TTS: 多模态DiT对齐与梅尔-潜在空间用于零样本高质量语音合成
机构 * Beijing Institute of Technology(北京理工大学) ; Kuaishou Technology(快手科技) ; Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所)
专题命中 音频语音多模态 :multi-modal(title,abstract);cross-modal(abstract)
AI总结 M3-TTS通过多模态扩散变换器实现零样本高质量语音合成,采用联合扩散层和梅尔-变体编码器,实现高效且自然的语音生成。
Comments Submitted to ICASSP 2026