发表机构
Ant Group(蚂蚁集团)
机构由 AI 辅助整理,请以论文原文为准。AI 中文总结
针对跨语言说话人验证的语言不匹配性能下降问题,利用自监督预训练模型提取通用声学特征训练解耦说话人嵌入网络,在TidyVoice2026基准上取得2.21%和2.99%的等错误率。
AI 中文摘要
说话人验证(SV)在语言不匹配场景下性能会下降,原因是说话人身份与特定语言的声学线索存在纠缠。为解决该问题,我们利用大规模自监督预训练模型(PTMs)学习与语言无关的说话人表征,将PTMs作为鲁棒的前端特征提取器,借助其从海量多样音频数据中习得的丰富声学与语言知识,用这些通用特征训练下游说话人嵌入网络,有效将说话人身份与特定语言特征解耦。我们在针对语言不匹配场景下SV的基准TidyVoice2026上验证方法,所提系统(T02团队)在tv26_eval-A上的等错误率(EER)为2.21%,在tv26_eval-U上为2.99%。
英文摘要
Speaker verification (SV) performance degrades under language mismatch due to the entanglement of speaker identity with language-specific acoustic cues. To address this problem, we leverage large-scale self-supervised pre-trained models (PTMs) to learn language-agnostic speaker representations. We utilize PTMs as robust front-end feature extractors, capitalizing on their rich acoustic and linguistic knowledge acquired from vast, diverse audio data. These generalized features are then used to train a downstream speaker embedding network, effectively disentangling speaker identity from language-specific characteristics. We validate our approach on the TidyVoice2026 benchmark, which benchmarks SV under language mismatch. Our proposed system (team T02) achieves equal error rates (EERs) of 2.21% on tv26_eval-A and 2.99% on tv26_eval-U.
CommentsInterspeech2026