arXivDaily arXiv每日学术速递 周一至周五更新

PAPERDAILY REPORTS

一个Whisper不够用?102个单语模型赢下77种语言

作者:arXivDaily编辑部 arXiv 2609.09554 cs · cs.CL

论文导读

加州大学圣地亚哥分校、EleutherAI联合制作BuzzASR,为102种语言分别微调Whisper语音识别模型。各语言最优版本在77种语言上超过Whisper-large-v3,字符错误率平均降低超过2.8倍;比较集中在FLEURS和Common Voice测试集,不代表每种口音、噪声和真实业务都保持同样幅度。

一个多语模型要照顾所有语言,资源少的语言容易吃亏

Whisper把大量语言放进同一模型和同一套多语词表,部署简单,但训练语料丰富的语言占据更多容量。一个词要被拆成多少token,也会影响解码长度和学习难度。对训练样本少、书写系统不同的语言,统一模型可能需要更多token才能表达同一句话,错误率也更高。

BuzzASR采用直接的办法:以Whisper-large-v3为起点,为FLEURS覆盖的102种语言分别训练专家。简单版只做单语语音微调;完整版还会替换单语词表,先用纯文本和语音做多任务适配,再回到语音识别训练。论文没有把这些专家合成一个模型,而是让每种语言选择自己的最佳版本。

图1:BuzzASR各语言最佳模型与Whisper-large-v3在102种语言上的识别结果对比。

换词表不是装饰,它直接缩短解码序列

完整流程先为目标语言训练新的分词器,再让模型通过纯文本任务熟悉新词表。随后加入语音识别训练,最后单独微调ASR。新的词表平均把“每个token能承载的字符数”提高3.3倍,个别语言最高达到21.7倍。相同句子需要生成的token变少,模型也更容易学习这种语言的常见字符组合。

图2:简单单语微调与包含词表替换、文本适配的完整训练流程。

不过,词表压缩改善和识别错误率下降不是严格一一对应。不同语言的数据量、书写系统与原始Whisper表现差异很大。团队因此同时保留简单微调和完整微调,逐语言选出更好的方案,而不是断言复杂流程在任何语言上都占优。

77种语言超过Whisper,27种拿到开源系统最佳结果

在FLEURS与Common Voice组合测试上,BuzzASR各语言最佳模型有77种超过Whisper-large-v3,字符错误率平均降低超过2.8倍。与其他公开模型比较时,27种语言取得论文所列开源系统中的最佳字符错误率。散点图中,大多数语言位于BuzzASR错误率更低的一侧,但仍有语言没有受益。

图3:逐语言比较BuzzASR最佳版本与Whisper-large-v3的字符错误率。

这些数字不是一个统一模型同时取得的成绩,而是102个语言专家分别取最佳结果。训练、验证和测试集也来自指定语料,会议录音、方言、代码切换与远场噪声可能产生新的分布差异。专家模型数量增多,还会增加模型选择、存储和更新负担。

多语言服务落地可在共享底座与专用专家之间取舍

BuzzASR已公开模型、代码和详细结果,开发者可以为目标语言直接选专家,也可以只复用词表替换与文本适配流程。下一步更有价值的测试,是在真实通话、口音迁移和混合语言里比较专家与统一模型,并研究多个相近语言是否能共享一个小型适配器。对于明确服务少数几种语言的产品,专用专家已经提供了比“大一统模型”更具体的选择。

参考资料

https://arxiv.org/abs/2609.09554

https://arxiv.org/html/2609.09554

https://lemn-lab.github.io/buzz-asr

https://huggingface.co/BuzzASR