arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

基于自监督预训练模型的跨语言说话人验证

Cross-Lingual Speaker Verification with Self-Supervised Pre-Trained Models

Jinghan Peng, Yu Zheng, Weiqiang Wang, Jian Liu

arXiv 2610.11099首次发表:更新:

发表机构

Ant Group(蚂蚁集团)

机构由 AI 辅助整理,请以论文原文为准。

AI 中文总结

针对跨语言说话人验证的语言不匹配性能下降问题,利用自监督预训练模型提取通用声学特征训练解耦说话人嵌入网络,在TidyVoice2026基准上取得2.21%和2.99%的等错误率。

AI 中文摘要

说话人验证(SV)在语言不匹配场景下性能会下降,原因是说话人身份与特定语言的声学线索存在纠缠。为解决该问题,我们利用大规模自监督预训练模型(PTMs)学习与语言无关的说话人表征,将PTMs作为鲁棒的前端特征提取器,借助其从海量多样音频数据中习得的丰富声学与语言知识,用这些通用特征训练下游说话人嵌入网络,有效将说话人身份与特定语言特征解耦。我们在针对语言不匹配场景下SV的基准TidyVoice2026上验证方法,所提系统(T02团队)在tv26_eval-A上的等错误率(EER)为2.21%,在tv26_eval-U上为2.99%。

英文摘要

Speaker verification (SV) performance degrades under language mismatch due to the entanglement of speaker identity with language-specific acoustic cues. To address this problem, we leverage large-scale self-supervised pre-trained models (PTMs) to learn language-agnostic speaker representations. We utilize PTMs as robust front-end feature extractors, capitalizing on their rich acoustic and linguistic knowledge acquired from vast, diverse audio data. These generalized features are then used to train a downstream speaker embedding network, effectively disentangling speaker identity from language-specific characteristics. We validate our approach on the TidyVoice2026 benchmark, which benchmarks SV under language mismatch. Our proposed system (team T02) achieves equal error rates (EERs) of 2.21% on tv26_eval-A and 2.99% on tv26_eval-U.

CommentsInterspeech2026

论文原文

arXiv 摘要页 · PDF 原文 · HTML 原文

↑