arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

MERaLiON-GR:适用于英语及东南亚语言的语音性别识别模型

MERaLiON-GR: Speech Gender Recognition Model for English and SEA Languages

Qiongqiong Wang, Ai Ti Aw, Nancy F. Chen, Ying Lay Chiu, Yang Ding, Yingxu He, Ridong Jiang, Zhuohan Liu, Yanfeng Lu, Yi Ma, Muhammad Huzaifah, Nabilah Binte Md Johan, Nattadaporn Lertcheva, Pham Minh Duc, Sailor Hardik Bhupendra, Siti Umairah Binte Mohammad Salleh, Shuo Sun, Tarun Kumar Vangani, Jeremy H. M. Wong, Jinyang Wu, Longyin Zhang

arXiv 2608.04433首次发表:更新:

发表机构

Institute of Advanced Intelligence and Computing (IAIC), A*STAR(先进智能与计算研究院(IAIC),新加坡科技研究局)

机构由 AI 辅助整理,请以论文原文为准。

AI 中文总结

本研究提出MERaLiON-GR语音性别识别模型,通过微调MERaLiON-SpeechEncoder-2并结合LoRA及多尺度ECAPA-TDNN网络,在多语言东南亚数据集上性能优于Vox-Profile和Audio-LLM,凸显专用语音模型的价值。

AI 中文摘要

我们提出了MERaLiON-GR,这是一个针对英语和东南亚(SEA)语言进行二分类(女性/男性)的语音性别识别系统。该模型对在广泛语音语料库上预训练的大型基于Conformer的Transformer模型MERaLiON-SpeechEncoder-2进行微调,通过低秩适配(LoRA)这种参数高效的微调方法使编码器适配性别识别任务,并附加带有注意力池化和轻量级线性分类器的多尺度ECAPA-TDNN下游网络。对多语言新加坡及东南亚语言(英语、汉语、马来语、泰米尔语、泰语、越南语、印度尼西亚语和高棉语)的广泛评估表明,MERaLiON-GR在完整话语和片段级评估模式下均始终优于最先进的性别识别模型Vox-Profile和大型音频大语言模型(Audio-LLM),这些结果凸显了专用语音模型在实现准确副语言理解和强大跨语言泛化能力方面的价值。

英文摘要

We present MERaLiON-GR, a speech gender recognition system that performs binary classification (female / male) on English and Southeast Asian (SEA) languages. The model finetunes MERaLiON-SpeechEncoder-2, a large conformer based transformer pre-trained on a broad speech corpus, and applies parameter efficient fine-tuning via Low-Rank Adaptation (LoRA) to adapt the encoder to the gender recognition task, and appends a multi-scale ECAPA-TDNN down stream network with attention pooling and a lightweight linear classifier. Extensive evaluations across multilingual Singaporean and Southeast Asian languages (English, Chinese, Malay, Tamil, Thai, Vietnamese, Indonesian, and Khmer) show that MERaLiON-GR consistently surpasses the state-of-the-art gender recognition model Vox-Profile and a large Audio-LLM, in both full-utterance and segment level evaluation modes. The results underscore the value of dedicated speech models in achieving accurate paralinguistic understanding and strong cross-lingual generalization.

论文原文

arXiv 摘要页 · PDF 原文 · HTML 原文

↑