arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

生成式语音增强的域增量学习

Domain-Incremental Learning for Generative Speech Enhancement

Manjunath Mulimani, Annamaria Mesaros, Minje Kim, Jesper Rindom Jensen

arXiv 2609.34901首次发表:更新:

发表机构

Aalborg University; Tampere University; University of Illinois Urbana-Champaign(奥尔堡大学; 坦佩雷大学; 伊利诺伊大学厄巴纳-香槟分校)

机构由 AI 辅助整理,请以论文原文为准。

AI 中文总结

本文提出一种基于语言模型的生成式语音增强域增量学习框架,通过轻量级低秩适配增量适应新域,在四个数据集上实现不遗忘旧域的有效增强。

AI 中文摘要

我们提出了一种用于生成式语音增强(SE)的域增量学习框架,该框架从在不同声学条件下记录的一系列数据集或域中学习。在持续演化的域上微调预训练模型会导致对先前获取知识的灾难性遗忘,而零样本泛化往往无法充分适应未见过的域。为了解决这些挑战,我们首先开发了一种新颖的基于语言模型的生成式语音增强模型,然后将其用作预训练骨干,并使用轻量级的特定域低秩适配(Low-Rank Adaptation)对其进行增量适配,以适应声学不匹配的域。所提出的框架使模型能够获取新域的增强能力,同时保持其在先前学习域上的性能。在四个异构语音数据集上的评估表明,我们的方法能够有效适应新域,而不会遗忘先前学习过的域。

英文摘要

We propose a domain-incremental learning framework for generative speech enhancement (SE) that learns from a sequence of datasets or domains recorded under diverse acoustic conditions. Fine-tuning a pretrained model on continuously evolving domains leads to catastrophic forgetting of previously acquired knowledge, while zero-shot generalization often fails to adequately adapt to unseen domains. To address these challenges, we first develop a novel language model-based generative SE model that we then use as a pretrained backbone and incrementally adapt it to acoustically mismatched domains using lightweight domain-specific Low-Rank Adaptation. The proposed framework enables the model to acquire enhancement capabilities for new domains while preserving performance on previously learned domains. Evaluated on four heterogeneous speech datasets, our approach effectively adapts to new domains without forgetting previously learned domains.

CommentsSubmitted to the IEEE International Conference of Acoustics, Speech, and Signal Processing (IEEE ICASSP 2027)

论文原文

arXiv 摘要页 · PDF 原文 · HTML 原文

↑