arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

去殖民化自动语音识别中的语言政策:跨文化胜任的语音AI框架

Decolonizing Linguistic Policies in Automated Speech Recognition: A Framework for Cross-Culturally Competent Speech AI

Jay L. Cunningham, Mark Atta Mensah, Richard Martinez, Joao Vieira da Silva Neto, Efi Dawodu

arXiv 2608.06141首次发表:更新:

发表机构

DePaul University; York University(德保罗大学; 约克大学)

机构由 AI 辅助整理,请以论文原文为准。

AI 中文总结

本文针对ASR及相关语音界面的殖民语言等级问题,提出含“三种危害”分类法、七层情境模型的框架,以受影响社区为协同者构建文化胜任的ASR参与式方案。

AI 中文摘要

本文聚焦自动语音识别(ASR)及由ASR介导的语音界面,这类技术塑造着人们获取公共服务、医疗保健与教育的途径。我们认为,低资源语言、原住民语言及非标准语言变体持续出现的失效问题,不只是技术错误,更是再生产殖民语言等级制度的隐性语言政策。借鉴语言资本、种族语言学意识形态、语言政策研究及去殖民计算的相关理论,我们阐明了数据、指标与模型先验如何决定哪些声音能被机器识别。我们提出了“三种危害(3M)”分类法——误识别(Misrecognition)、错位(Misalignment)与不信任(Mistrust),以及适用于ASR及ASR介导语音界面中语言多样性的七层情境模型。随后,我们为具备文化胜任力的ASR提出了参与式框架与最低审计协议,将受影响社区定位为协同设计者、评估者与治理伙伴。

英文摘要

This paper focuses on automatic speech recognition (ASR) and ASR-mediated voice interfaces that shape access to public services, healthcare, and education. We argue that persistent failures for low-resource, Indigenous, and non-standard language varieties are not only technical errors, but also implicit linguistic policies that reproduce colonial language hierarchies. Drawing on linguistic capital, raciolinguistic ideology, language policy research, and decolonial computing, we show how data, metrics, and model priors determine whose voices become machine-legible. We introduce the Three Harms (3M) taxonomy---Misrecognition, Misalignment, and Mistrust---and a seven-layer situatedness model for linguistic diversity in ASR and ASR-mediated voice interfaces. We then propose a participatory framework and minimum audit protocol for culturally competent ASR, positioning affected communities as co-designers, evaluators, and governance partners.

Comments10 Pages, 2 Figures, 2 Tables, Interspeech 2026 - Sydney, Australia

论文原文

arXiv 摘要页 · PDF 原文 · HTML 原文

↑