发表机构
SaluteDevices, Russia(SaluteDevices)
机构由 AI 辅助整理,请以论文原文为准。AI 中文总结
针对多语言ASR中长尾语言数据稀缺问题,提出GigaAM Multilingual,用Conformer编码器在大量音频上预训练,预训练时引入聚类级数据平衡策略,微调时采用领域感知采样方法,在目标语言上优于其他编码器,发布相关模型提供多语言适应方法。
AI 中文摘要
尽管近期在模型扩展方面取得了成功,但多语言语音识别(ASR)性能仍极不均衡,长尾语言面临严重数据稀缺问题。本文旨在应对为中亚低资源语言(哈萨克语、吉尔吉斯语、乌兹别克语)构建强大基础模型的挑战。我们提出了GigaAM Multilingual,这是一种使用HuBERT风格目标在200万小时音频上预训练的Conformer编码器。关键的是,我们在预训练期间引入了聚类级数据平衡策略,在微调期间引入了领域感知采样方法,以减轻主导语言的优势。在对照比较中,我们的方法在目标语言上优于强大的开放预训练编码器(Whisper Large v3、Omnilingual-1B),在保持效率的同时,在自发语音方面取得了显著进展。我们发布了基础编码器和ASR模型,为在现实数据不平衡情况下进行有效的多语言适应提供了经过验证的方法。
英文摘要
Despite recent scaling successes, multilingual ASR performance remains highly uneven, with long-tail languages suffering from severe data scarcity. This work addresses the challenge of building robust foundation models for underrepresented Central Asian languages (Kazakh, Kyrgyz, Uzbek). We present GigaAM Multilingual, a Conformer encoder pre-trained on 2M hours of audio using a HuBERT-style objective. Crucially, we introduce a cluster-level data balancing strategy during pre-training and a domain-aware sampling method during fine-tuning to mitigate head-language dominance. In controlled comparisons, our approach outperforms strong open pretrained encoders (Whisper Large v3, Omnilingual-1B) on target languages, achieving significant gains on spontaneous speech while maintaining efficiency. We release the foundation encoder and ASR model, offering a proven recipe for effective multilingual adaptation under realistic data imbalance.
CommentsAccepted to Interspeech 2026. Model weights: https://github.com/salute-developers/GigaAM