感知上更优,语义上更差:衡量语音增强对基于大语言模型的语音系统的影响
Perceptually Better, Semantically Worse: Measuring Speech Enhancement Impact on LLM-Based Voice Systems
浏览论文内容
中文总结 AI 辅助
该研究针对语音增强对LLM语音系统的影响问题,提出输出分歧率(ODR)指标,通过基准测试发现标准音频质量指标无法适配LLM流程质量评估,验证了SE引发的语义失真会传递至下游LLM任务。
中文摘要 AI 辅助
语音增强(SE)通常被用作口语人工智能流程中的预处理步骤,其假设前提是更好的音频质量可提升下游任务性能。然而,SE引发的失真是否会传递到下游大语言模型(LLM)任务性能中仍是一个悬而未决的问题。我们提出输出分歧率(ODR),用于衡量SE相对于干净语音改变LLM意图分类的频率,并使用Whisper large-v3与wav2vec2-large级联模型,在2974个SLURP音频片段上对5种条件进行基准测试。所有条件的ODR均显著高于零(p<0.001,二项式检验)。尽管MetricGAN{+}提升了PESQ,但它的ODR比未增强的带噪语音高出一倍以上(0.318 vs. 0.135);未抑制的回声通过说话人替换达到0.836的ODR,这是词错误率(WER)无法捕捉的失效情况。音频质量指标与ODR的相关性从接近零到中等不等(SQUIM-MOS ρ=-0.068,PESQ ρ=-0.467)。MetricGAN{+}和回声的结果在自动语音识别(ASR)架构上可重复,表明标准音频质量指标不足以评估LLM流程的质量。
英文摘要
Speech enhancement (SE) is commonly applied as a preprocessing step in spoken AI pipelines under the assumption that better audio quality improves downstream task performance. Whether SE-induced distortions propagate to downstream LLM task performance remains an open question. We introduce Output Divergence Rate (ODR), which measures how often SE changes an LLM's intent classification relative to clean speech, and benchmark five conditions on 2,974 SLURP clips using Whisper large-v3 and wav2vec2-large cascades. Every condition produces ODR significantly above zero ($p < 0.001$, binomial test). MetricGAN{+} more than doubles ODR versus unenhanced noisy speech (0.318 vs. 0.135) despite improving PESQ, and unmitigated echo reaches an ODR of 0.836 through speaker substitution, a failure WER cannot capture. Audio quality metrics range from near-zero to moderate correlation with ODR (SQUIM-MOS $ρ=-0.068$, PESQ $ρ=-0.467$). The MetricGAN{+} and echo results replicate across ASR architectures, indicating that standard audio quality metrics are insufficient for LLM pipeline quality.
发表机构
- GN Group(GN集团)
机构由 AI 辅助整理,请以论文原文为准。