伊比利亚语言自动语音识别工具基准评测
Benchmarking Automatic Speech Recognition Tools for Iberian Languages
浏览论文内容
中文总结 AI 辅助
该研究对十一个ASR系统在五种伊比利亚语言及两种对照语言上进行基准测试,发现无单一模型全面占优,低资源语言性能显著下降且存在性别差异,为实际模型选择提供指导。
中文摘要 AI 辅助
针对伊比利亚语言的自动语音识别(ASR)综合评估仍然有限,低资源语言、偏差和效率权衡问题尚未得到充分探索。我们对十一个系统(十个开放权重模型和一个商业API)在五种伊比利亚语言(巴斯克语、加泰罗尼亚语、加利西亚语、葡萄牙语、西班牙语)上进行了基准测试,并以德语和土耳其语作为对照。评估使用了一个包含朗读语音、广播媒体和有声读物的85小时数据集,通过词错误率(WER)和实时因子(RTF/RTFx)评估准确性和效率。结果显示,没有单一模型占据主导地位:准确性、效率和语言覆盖之间存在明显的权衡。低资源语言,尤其是巴斯克语,性能显著下降,凸显了训练覆盖的重要性。我们观察到大多数系统存在一致的性别差异,凸显了多语言ASR中的公平性挑战。总体而言,该基准为现实世界中的模型选择提供了实用指导。
英文摘要
Comprehensive evaluations of automatic speech recognition (ASR) for Iberian languages remain limited, and low-resource languages, biases, and efficiency trade-offs are underexplored. We benchmark eleven systems, ten open-weight models and one commercial API, across five Iberian languages (Basque, Catalan, Galician, Portuguese, Spanish), with German and Turkish as controls. Evaluation uses an 85-hour dataset covering read speech, broadcast media, and audiobooks, assessing accuracy and efficiency via word error rate (WER) and real-time factors (RTF/RTFx). Results show no single model dominates: accuracy, efficiency, and language coverage present clear trade-offs. Low-resource languages, especially Basque, degrade significantly, highlighting the role of training coverage. We observe consistent sex disparities across most systems, highlighting fairness challenges in multilingual ASR. Overall, the benchmark provides practical guidance for real-world model selection.
发表机构
- Telefónica Innovación Digital(西班牙电信数字创新)
- Universidad Autónoma de Madrid(马德里自治大学)
机构由 AI 辅助整理,请以论文原文为准。