arXivDaily arXiv每日学术速递 周一至周五更新

PAPERDAILY REPORTS

不到68万字节,sanoTTS无需NPU在ESP32上实时生成语音

作者:arXivDaily编辑部 arXiv 2608.21378 cs · cs.SD

一个完整神经语音合成系统,从音素ID一路生成22.05kHz波形,部署图只有567008个参数,两个int8数据块合计679832字节。Ampixa Labs提出sanoTTS,在不使用神经加速器的ESP32-S3上,生成4.54秒语音耗时1.02秒,实时因子为0.22。

小体积换来了明显音质代价:嵌入式模型在未见文本上的SCOREQ为2.54、UTMOS为2.80,Kristin教师分别为4.68和4.42。论文把速度、体积和质量放在同一张账单里,没有把“能实时运行”写成“声音接近桌面模型”。

从音素到波形的链路全部放进微控制器

系统由时长模型、声学模型和逆短时傅里叶变换解码器组成。教师来自Piper/VITS,训练时提供对齐、潜变量和波形目标;部署时不再运行教师,声学学生直接预测解码器需要的40维中间表示。

论文Figure 1:教师VITS产生蒸馏目标,部署链路由时长、声学和iSTFT解码器组成。

最终嵌入式c-line包含36164个时长参数、199536个声学参数和331308个解码器参数,总计567008。论文把模型权重、运行时端口、黄金向量和校验和一起纳入审计范围。

声学模型使用五个帧块,解码器在帧域执行逆STFT。固定40维接口让训练端和部署端可以分别核对中间结果,出现误差时能判断来自时长、声学预测还是波形合成,而不是只比较最终音频。

最小部署档和音质档使用不同教师

嵌入式档从Kristin教师蒸馏,目标是微控制器实时运行;音质档改用更强的Amy教师,1454284参数版本达到4.13 SCOREQ和4.10 UTMOS,1834380参数版本达到4.16 SCOREQ。两组不能当作同一模型从56万参数逐步放大后的严格消融。

论文Tables 1–2与Figure 2:567008参数嵌入式档、较大音质档及其模型组成。

作者还做了解码器容量分析。控制实验显示,主要音质损失来自解码器容量,而不是输出表示形式;扩大解码器能提高分数,却会迅速增加每秒乘加次数,不再适合当前MCU预算。

自动分数曾被窄测试集高估

早期版本只在12条模板句上测试,SCOREQ达到3.07;换到更广的14343条未见文本后,同一模型降到1.72,差了1.35。当前嵌入式模型在扩展训练与多样测试后报告2.54。

论文Table 3:嵌入式模型、诊断模型、Amy音质档与教师模型的SCOREQ、UTMOS等指标。

聚合指标还漏掉过一次擦音缺陷。作者通过试听和按音素分解的频谱探针发现问题,说明在极小TTS上,只看平均自动分数会掩盖某些音类的明显失真。

论文报告嵌入式模型归一化词错率为14.8%,但没有为每个后续版本重复记录词错率,因此作者主动拒绝做不匹配比较。质量分、可懂度和硬件速度来自不同实验表,本文也不把它们拼成一个综合排名。

ESP32-S3实时,ESP32-C3仍是离线目标

ESP32-S3端到端路径把4.54秒语音的计算从6.685秒优化到1.021秒,实时因子0.22。没有浮点单元的ESP32-C3生成1.56秒语音需8.900秒,实时因子5.72,仍不能实时播放。

论文Table 4与Figure 3:ESP32-S3、ESP32-C3、主机和WebAssembly上的完整合成吞吐。

论文测量的是神经合成计算,不包含音频播放和首个样本延迟;ESP32-S3结果也只对应Kristin嵌入式模型,不能推到更大的Amy音质档。

下一步是补试听、首包延迟和多语言复现

不到1MB的完整TTS适合离线语音提示、玩具、家电和低功耗终端。进入产品前还要报告能耗、内存峰值、首次出声延迟和更大规模主观听测,并检查不同说话人和语言是否能在相同预算下复现。

论文给出的代码链接在本次核验时返回404,因此不能宣称代码已经可下载。现有结论以论文内的模型清单、校验和与硬件测量为准,后续开放仓库后再核对二进制与报告结果是否一致。

多语言版本目前只证明配方可以更换教师、权重和前端,还没有与英文相同的跨语言感知测试。对家电语音提示这类短句任务,模板覆盖也应由实际产品语料决定,不能沿用论文早期的12句窄测试。

参考资料

https://arxiv.org/abs/2608.21378

https://arxiv.org/pdf/2608.21378