POWSM: A Phonetic Open Whisper-Style Speech Foundation Model
POWSM:一种基于语音的开放式耳语风格语音基础模型
机构 * Carnegie Mellon University(卡内基梅隆大学) ; University of California, Berkeley(加州大学伯克利分校) ; University of Texas, Austin(德克萨斯大学奥斯汀分校) ; University of British Columbia(不列颠哥伦比亚大学)
AI总结 POWSM是一种能够联合执行多种语音任务的统一框架,实现了音频、文本和音素之间的无缝转换,并在低资源条件下提升了语音处理性能。
Comments 18 pages, under review. Model available at https://huggingface.co/espnet/powsm