论文导读
小米ASR团队提出Xiaomi-CocktailASR-1,用一段参考语音当“声纹提示词”,从多人重叠声音中只转写目标说话人;目标人没开口时,模型应输出空文本。它在AliMeeting远场测试的词错率为20.63%,但论文没有说明这项能力已经进入小米消费产品。
多人说话时,普通转写模型会把声音混在一起
会议室里两三个人同时开口,录音只有一条声道。普通语音识别模型要么把多个人的话拼成一段,要么漏掉被盖住的内容。目标说话人识别多了一项输入:先给模型一小段目标人的参考语音,再要求它只输出这个人的话。
Xiaomi-CocktailASR-1把参考语音编码成说话人特征,与混合语音一起送进识别模型。团队没有先做语音分离再转写,而是让端到端模型同时判断“谁在说”和“说了什么”。同一架构还处理单人语音,以及目标人根本不在录音里的负样本。
图1:模型覆盖多说话人识别、单说话人识别、目标人缺席拒识和推理模式。
目标人不在场时,正确答案是空白
很多模型即使没听到目标人,也会从干扰声音里硬转出文本。论文专门构造负样本:参考语音属于一个未出现在混合录音中的人,模型只有输出空文本才算拒识正确。中文测试还覆盖Aishell负样本和团队采集的真实场景负样本。
模型可选用一段推理过程,先判断录音里有几个说话人,再比较参考声音与候选声音的相似度,最后决定转写或留空。论文把这段过程作为辅助能力展示;核心指标仍是目标说话人的词错率、拒识率和误拒率。
图2:参考语音、混合语音和文本指令进入同一端到端目标说话人识别架构。
真实会议词错率20.63%,负样本也要看误拒
在AliMeeting-Far远场测试中,小米模型词错率20.63%,对比的MC-TS-ASR为27.50%;在AMI-SDM上为21.81%,与SQ-Whisper的22.0%接近。合成LibriMix双人混合中,词错率4.11%,比TCP的4.84%低,但三人混合时为12.29%,难度上升明显。
图中展示单人、双人和目标人缺席时的输入、说话人判断与输出。
拒识能力会带来另一种错误:目标人明明在说话,模型却输出空白。LibriSpeech单人测试中,它的误拒率为0.36%,非空结果词错率1.73%。这个代价不大,但说明产品端不能只看“拒掉多少干扰”,还要同时看误拒和延迟。
下一步是验证更多真实设备和说话距离
论文覆盖合成混音、远场会议和中英文测试,证明一套架构能兼顾单人、多人与拒识。下一步需要增加手机、耳机、车机和会议终端的真实麦克风数据,检查回声、噪声、口音以及参考语音过短时的变化。
如果进入产品,用户还需要明确知道声纹如何保存、何时启用和怎样撤销。当前工作是一份技术报告,没有给出部署延迟、模型大小、隐私策略或具体上线计划,这些信息决定它能否从实验走到日常转写。