基于自回归语音先验的语音增强测试时自适应
Test-time adaptation for speech enhancement with an autoregressive speech prior
浏览论文内容
中文总结 AI 辅助
该研究提出一种基于自回归语音先验的单utterance测试时自适应方法,通过最小化分布散度提升语音增强模型在噪声不匹配场景下的性能,相关成果已在线公开。
中文摘要 AI 辅助
测试时自适应(TTA)为在不依赖带标注目标数据的情况下改善语音增强模型在不匹配声学条件下的性能提供了有前景的方向。本研究提出一种单utterance(单 utterance,即单段语音)TTA方法,利用从神经音频编解码器提取的干净语音隐表示训练得到的自回归先验,对预训练的语音增强模型进行正则化;自适应过程通过最小化增强语音分布与干净语音先验之间的Kullback-Leibler散度完成。在多个带噪语音数据集上开展的实验表明,该方法可稳定提升语音质量,尤其在训练-测试噪声不匹配条件下效果显著,代码与音频示例已在线公开。
英文摘要
Test-time adaptation (TTA) offers a promising direction for improving speech enhancement models under mismatched acoustic conditions, without requiring access to labeled target data. In this work, we propose a single-utterance TTA method that regularizes a pretrained speech enhancement model using an autoregressive prior trained on clean speech latent representations extracted from a neural audio codec. Adaptation is performed by minimizing the Kullback-Leibler divergence between the enhanced speech distribution and the clean speech prior. Experiments across multiple noisy speech datasets show consistent improvements in speech quality, particularly under training-testing noise mismatch conditions. Code and audio examples are available online.
发表机构
- CentraleSupélec(中央超级电子学院)
- Inria(法国国家信息与自动化研究所)
- University of Hamburg(汉堡大学)
机构由 AI 辅助整理,请以论文原文为准。