arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~
arXiv 2608.16125eess.ASeess.SP

实时磁共振成像(rtMRI)场景下的语音增强方法研究:信号质量、源保留及下游任务的系统评估

Navigating Speech Enhancement for Real-Time MRI: A Systematic Assessment of Signal Quality, Source Preservation, and Downstream Tasks

Huang-Cheng Chou, Sean Foley, Haley Hsu, Kevin Huang, Szu-Jui Chen, Rong Chao, Louis Goldstein, Khalil Iskarous, Dani Byrd, Yu Tsao, Sudarsana Reddy Kadiri, Joh… 展开作者

Huang-Cheng Chou, Sean Foley, Haley Hsu, Kevin Huang, Szu-Jui Chen, Rong Chao, Louis Goldstein, Khalil Iskarous, Dani Byrd, Yu Tsao, Sudarsana Reddy Kadiri, John H. L. Hansen, Shrikanth Narayanan

首次发表
浏览论文内容

中文总结 AI 辅助

本研究评估3种现成语音增强系统对rtMRI音频的效果,发现其增强效果与任务终点相关,无通用最优系统,增强音频为特定任务衍生物而非通用改进替代。

中文摘要 AI 辅助

实时磁共振成像(rtMRI)期间录制的音频会被扫描仪噪声严重污染,但通用语音增强是否能为语音研究和下游处理优化信号仍不明确。本研究针对5个rtMRI语料库,采用自然录制输入、干净输入探针及存档配对加性噪声探针,评估了3种现成系统——Denoiser、PASE和RE-USE。多任务评估涵盖学习型质量预测器、说话人及音素表示、基于参考的可懂度与质量指标、声学-语音探针、自动语音识别(ASR)及副语言任务。核心结果为增强效果与任务终点相关:更高的预测质量分数并不一定意味着更好的ASR性能或更高的源保真度。在使用语料库提供的处理后输入的15个语料库-识别器对比中,RE-USE在11个对比中产生更低的词错误率(WER)点估计,而Denoiser在13个对比中产生更高的估计。在配对加性噪声探针中,PASE和RE-USE提升了识别音素一致性、可懂度及感知质量点估计;Denoiser提升了识别音素一致性和短时客观可懂度(STOI),但降低了说话人嵌入相似度。没有系统在所有语料库、识别器及任务终点上均表现最佳。因此,增强后的rtMRI音频应被视为特定任务的变换衍生物,而非原始或DSP处理波形的通用改进替代品。

英文摘要

Audio recorded during real-time magnetic resonance imaging (rtMRI) is heavily contaminated by scanner noise, but it remains unclear whether general-purpose speech enhancement improves the signal for speech research and downstream processing. Three off-the-shelf systems---Denoiser, PASE, and RE-USE---are evaluated across five rtMRI corpora using naturally recorded inputs, a clean-input probe, and an archived paired additive-noise probe. The multi-task evaluation spans learned quality predictors, speaker and phone representations, reference-based intelligibility and quality measures, acoustic--phonetic probes, automatic speech recognition (ASR), and paralinguistic tasks. The central result is that enhancement effects are endpoint dependent: higher predicted-quality scores do not reliably imply better ASR performance or greater source fidelity. Across 15 corpus--recognizer comparisons using corpus-provided processed inputs, RE-USE yielded lower word-error-rate point estimates in 11, whereas Denoiser yielded higher estimates in 13. In the paired additive-noise probe, PASE and RE-USE improved recognized-phone agreement, intelligibility, and perceptual-quality point estimates. Denoiser improved recognized-phone agreement and short-time objective intelligibility (STOI) but reduced speaker-embedding similarity. No system was uniformly best across corpora, recognizers, and endpoints. Enhanced rtMRI audio should therefore be treated as a task-specific transformed derivative rather than a universally improved replacement for the original or DSP-processed waveform.

补充信息

↑