arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~
arXiv 2608.10106eess.AS

BiTSE:面向AR眼镜阵列的嘈杂多说话人环境下双耳目标说话人提取

BiTSE: Binaural Target Speaker Extraction in Noisy Multi-Talker Environments for AR Glass Arrays

Selani A. Indrapala, Wageesha N. Manamperi

AI总结:

针对AR眼镜阵列的嘈杂多说话人场景,研究提出BiTSE框架,整合DoA感知注意力、时间戳掩码及两阶段损失优化,在SPEAR数据集上优于传统方法,提升了语音提取的信号保真度与感知质量。

AI中文摘要:

在嘈杂的多说话人对话场景中分离出所需的语音信号,是增强现实(AR)可穿戴麦克风阵列系统的关键需求。本研究提出了一种名为BiTSE的双耳目标说话人提取(TSE)框架,该框架利用空间和时间线索,特别是目标说话人的到达方向(DoA)和对应的语音活动信息,来引导提取过程。我们的模型基于双耳信号去噪架构构建,整合了三项关键改进:(i)采用循环位置嵌入的DoA感知注意力机制;(ii)利用说话人活动抑制非目标片段的基于时间戳的掩码策略;(iii)一种新颖的两阶段损失优化策略,先训练模型实现鲁棒去噪,再进行微调以提升感知质量。在增强现实语音增强(SPEAR)挑战赛数据集上的评估表明,所提出的BiTSE始终优于传统方法,提升了信号保真度和感知质量。

英文摘要:

Isolating a desired speech signal in noisy multi-talker conversational scenarios is a key requirement for augmented reality (AR) wearable microphone array systems. In this work, a binaural target speaker extraction (TSE) framework, termed BiTSE, is proposed. It leverages both spatial and temporal cues, specifically the direction-of-arrival (DoA) of the target speaker and corresponding voice activity information, to guide the extraction process. Built upon a binaural signal denoising architecture, our model integrates three key enhancements: (i) a DoA-aware attention mechanism using cyclic positional embeddings, (ii) a timestamp-based masking strategy that utilizes speaker activity to suppress non-target segments, and (iii) a novel two-stage loss optimization strategy that first trains the model for robust denoising and then fine-tunes it to improve perceptual quality. Evaluations on the SPeech Enhancement for Augmented Reality (SPEAR) challenge dataset demonstrate that the proposed BiTSE consistently improves upon conventional approaches, leading to enhanced signal fidelity and perceptual quality.

补充信息

↑