arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

Bulbul:一个用于阿拉伯语方言语音识别的数据集

Bulbul: A Dataset for Dialectal Arabic Speech Recognition

Ahmed Ashraf, Aisha Alansari, Fadel Al Abbas, Nada Almarwani, Samah Aloufi, Saad Ezzini, Maged S. Al-Shaibani, Doaa Dalaq, AbdelRahim A. Elmadany, Muhammad Abdul-Mageed, Mohamed Mehdi Trigui, Dania Refai, Layan Refai, Mohamed Akrout, Mustafa Jarrar, Wasfi G. Al-Khatib, Alaa Dalaq, Darin El-Nakla, Samir Abdaljalil, Abdulrahman Al-Fakih, Nour El Imane Zeghib, Moussa Redah, Salmane Chafik, Mohamed El-Attar, Rima Grati, Sarah Kohail, Malak Alkhorasani, Khadijah Al Safwan, Ismail M. Mudhaffar, Ali Altam, Ahmed Al-Shaikh, Adnan Saeed, Hamzah Luqman

arXiv 2608.21950首次发表:更新:

发表机构

KFUPM; Taibah University; UBC; PSUT; Birzeit University; HBKU; Texas A&M University; Mohammed VI Polytechnic University; Zayed University; IAU; Symbiosis International University; Taiz University(法赫德国王石油和矿产大学; 塔伊巴大学; 不列颠哥伦比亚大学; 约旦理工大学; 比尔宰特大学; 哈马德·本·哈利法大学; 德克萨斯农工大学; 穆罕默德六世理工大学; 扎耶德大学; 伊玛目阿卜杜勒拉赫曼·本·费萨尔大学; 共生国际大学; 塔伊兹大学)

机构由 AI 辅助整理,请以论文原文为准。

AI 中文总结

该研究针对阿拉伯语ASR的方言资源不足问题,构建了多方言数据集BULBUL并完成两级质量验证,还为相关ASR系统建立了强基线。

AI 中文摘要

阿拉伯语自动语音识别(ASR)因双语现象、广泛的区域方言差异及有限的语音资源面临独特挑战。现有语音数据集常聚焦单一方言或大规模广播/网络数据,导致语言多样性与标注质量间存在权衡。我们提出BULBUL,这是一个来自11个阿拉伯国家275名说话者的多方言阿拉伯语ASR数据集。BULBUL包含结构化的方言及亚方言覆盖,还收录了参与者以其本地方言口音说出的古典阿拉伯语与现代标准阿拉伯语的录音,以支持感知口音的建模。录音质量通过两级人工验证流程确保。我们还对一系列近期ASR系统进行了基准测试,为现代方言及带口音的阿拉伯语ASR建立了强基线。

英文摘要

Arabic automatic speech recognition (ASR) faces unique challenges due to diglossia, extensive regional dialect variation, and limited speech resources. Existing speech datasets often focus on single dialects or large-scale broadcast/web data, leading to trade-offs between linguistic diversity and annotation quality. We present BULBUL, a multi-dialect Arabic ASR dataset collected from 275 speakers in 11 Arab countries. BULBUL includes structured dialect and sub-dialect coverage, as well as recordings of classical Arabic and modern standard Arabic spoken by participants in their native dialectal accents to support accent-aware modeling. The quality of the recordings was ensured through a two-level human verification process. We further benchmark a range of recent ASR systems, establishing strong baselines for modern dialectal and accented Arabic ASR.

论文原文

arXiv 摘要页 · PDF 原文 · HTML 原文

↑