arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

Qwen-Audio-3.0-TTS:基于多阶段训练范式的可自由控制且高度鲁棒的语音合成

Qwen-Audio-3.0-TTS: Freely Controllable and Highly Robust Speech Synthesis with Multi-Stage Training Paradigm

Bajian Xiang, Cheng Wen, Han Zhao, Hao Wang, Haoxu Wang, Jiawei Jin, Jiayan Cui, Jie Chen, Mengxi Nie, Tianyu Zhao, Weiqin Li, Xiang Lv, Xiangang Li, Yang Xiang, Yang Zhou

arXiv 2607.23938首次发表:更新:

AI 中文总结

介绍Qwen-Audio-3.0-TTS语音合成系统,结合低帧率分词器与五阶段训练范式,通过自然语言指令等实现生产级控制,支持多语言多方言,在多种评估中性能优异,为生产级语音合成奠定基础。

AI 中文摘要

在本报告中,我们展示了Qwen-Audio-3.0-TTS,这是一个面向生产的语音合成系统,在内容一致性、说话者相似度、韵律自然度、音频质量、可控性、多语言覆盖、效率和鲁棒性方面取得了共同进步。它结合了一个12.5Hz的低帧率语音分词器以减少推理延迟,并采用五阶段渐进训练范式来协调语言模型(LM)和流匹配模型(FM)的优化。该模型通过自由风格的自然语言指令和细粒度内联标签提供生产级控制,支持16种语言、20个中国方言地区、长达3分钟的单通道长格式合成,以及从嘈杂、混响或不清晰的参考语音中进行鲁棒生成。在SEED-TTS-Eval、CV3-Eval、指令跟随、长格式和声学鲁棒性评估中,Qwen-Audio-3.0-TTS在许多报告维度上取得了领先性能或最强的综合结果。它还在独立的人工分析文本到语音排行榜上排名第一。这些结果为生产级语音合成奠定了坚实基础。

英文摘要

In this report, we present Qwen-Audio-3.0-TTS, a production-oriented speech synthesis system that jointly advances content consistency, speaker similarity, prosodic naturalness, audio quality, controllability, multilingual coverage, efficiency, and robustness. It combines a 12.5~Hz low-frame-rate speech tokenizer for reduced inference latency with a five-stage progressive training paradigm for coordinated language model (LM) and flow-matching model (FM) optimization. The model provides production-level control through free-style natural-language instructions and fine-grained inline tags, while supporting 16 languages, 20 Chinese dialect regions, one-pass long-form synthesis up to 3 minutes, and robust generation from noisy, reverberant, or unclear reference speech. Across SEED-TTS-Eval, CV3-Eval, instruction-following, long-form, and acoustic-robustness evaluations, Qwen-Audio-3.0-TTS achieves state-of-the-art performance on many reported dimensions or the strongest aggregate results. It also ranks first on the independent Artificial Analysis Text-to-Speech Leaderboard. These results establish Qwen-Audio-3.0-TTS as a strong foundation for production-level speech synthesis.

Comments19 pages

论文原文

arXiv 摘要页 · PDF 原文 · HTML 原文

↑