Speak in Context: Multilingual ASR with Speech Context Alignment via Contrastive Learning
在语境中说话:通过对比学习实现的多语言语音识别与语音语境对齐
机构 * Institute for Analytics and Data Science, University of Essex(数据分析与科学研究所,埃塞克斯大学) ; School of Computer Science and Electronic Engineering, University of Essex(计算机科学与电子工程学院,埃塞克斯大学)
专题命中 音频语音多模态 :cross-modal(abstract);分类 cs.CL
AI总结 本文提出一种基于对比学习的多语言语音识别框架,通过语境对齐提升识别性能,支持多种语言和口音,实现语音与上下文的高效交互。
Comments Accepted at LREC 2026