只有一段参考录音,不知道录音里说了什么,模型也能提取音色并用另一种语言合成新内容。网易有道发布Confucius4-TTS技术报告,系统覆盖14种语言,支持同语种和跨语种零样本声音克隆,不要求在推理前准备提示音频的文字稿;代码、模型权重和演示已公开。
许多零样本TTS需要同时输入参考音频及其准确转写。真实素材往往来自采访、旧录音或临时语音,没有字幕;遇到陌生语言时,先做ASR还会引入转写错误,跨语种克隆因此多了一道门槛。
可学习说话人编码器直接从录音抓取音色
Confucius4-TTS采用文本到语义、语义到声学的两阶段架构。第一阶段由基于大语言模型的T2S模块读取目标文本;可学习说话人编码器从自监督语音表征中提取音色,不依赖参考录音的文字内容。模型把“说什么”和“由谁来说”分成不同条件。
Confucius4-TTS文本到语义模块与说话人条件。
第二阶段使用条件流匹配S2A模块,把预测的语义Token转换为梅尔频谱,再还原为波形。若用户确实有参考文本,系统也支持延续式克隆;免转写并没有删除原有用法,而是增加了处理野外无字幕录音的路径。
同一种声音跨过14种语言
系统在大规模多语种语音数据上训练,覆盖14种语言。跨语种场景中,参考录音和目标文本可以属于不同语言,例如参考中文声音,再输入另一种支持语言的句子。模型需要保留说话人音色,同时按照目标语言的音素和节奏清楚发音。
论文中的跨语种零样本TTS训练与推理流程。
这比同语种续写更难。参考声音中的口音、韵律和音色纠缠在一起,模型若过度复制源语言发音习惯,目标语言可懂度会下降;若过度追求标准发音,人物声音又可能不像。两阶段结构让语义内容与声学身份在不同模块中接受约束。
免转写也减少了ASR错误的连锁影响。传统流程一旦把人名、方言词或噪声片段转错,错误文本会和真实语音不匹配,TTS难以判断哪些声学特征属于音色。说话人编码器直接读取自监督语音表示,参考录音只负责提供身份线索。
六个跨语种方向平均WER为3.73%
在CV3-Eval跨语种基准的六个方向上,Confucius4-TTS取得平均3.73%的词错误率。论文还报告了说话人相似度和可懂度表现;在团队内部跨语种集合的人评中,它在近期开放和商业系统之间取得最佳平均综合排名。
Confucius4-TTS论文中的跨语种评测设置。
内部人评无法替代独立第三方测试,3.73%也只对应CV3-Eval列出的六个方向,并非14种语言所有组合都达到相同数字。噪声录音、强口音、极短提示和情绪表达仍需要按具体语言单独检验。
不同系统的语音可懂度与说话人相似度结果。
从无字幕素材走向授权配音工作流
免转写可以缩短影视本地化、有声内容和个性化语音的准备流程。制作方在取得授权后,可直接用一段干净录音建立声音条件,再生成多语种台词;旧素材没有字幕时,也不用先人工逐字转写参考片段。
声音克隆涉及身份冒用风险。进入产品时需要明确授权、合成标识、水印和可追溯记录,公开模型也应配套安全策略。Confucius4-TTS已经降低技术入口,下一步评价重点会从“能不能克隆”转向复杂录音质量、长文本稳定性和各语言的真实听感。
对于14种语言,还需要逐一公开提示时长、噪声条件、口音覆盖和人评样本,让用户知道哪种组合已经充分验证。跨语种系统的平均分容易掩盖低资源语言差异,产品端更适合按目标语言给出独立质量与置信度报告。
长文本还要观察同一段音色在数分钟内是否稳定,数字、专有名词和中外文混读是否会突然改变说话人特征。开放权重让研究者可以在统一样本上复测这些细节,也便于为特定语言补充数据和发音规则。