arXivDaily arXiv每日学术速递 周一至周五更新

PAPERDAILY REPORTS

语音助手终于会看上下文:OPPO让中英文同音词召回涨11个点

作者:arXivDaily编辑部 arXiv 2609.18680 cs · cs.CL · cs.SD

论文导读

OPPO AI中心推出HearInContext,用3764个中英文语义样例测试语音识别能否根据对话上下文区分同音词。微调Qwen3-ASR-1.7B后,中文和英文隐式上下文目标词召回分别提高11.0和11.5个百分点,而AISHELL-1与LibriSpeech错误率变化低于0.1个百分点;提升主要针对该同音词测试。

声音相同,上一轮对话决定你说的是哪个词

语音识别遇到同音词时,仅凭波形很难判断含义。英语里的flour与flower、中文里的近音词,都需要主题和语境。很多“上下文ASR”实际依赖显式热词列表,系统事先已经知道候选词;真实对话却常只给出隐含线索,并不会直接把正确答案写在历史里。

图1:相同或相近发音可由前文语义指向不同词语。

HearInContext为同一段合成语音配上不同的助手回复,构造多种解释。隐式上下文排除候选目标词,只通过语义暗示答案;显式上下文直接点出目标;无上下文和无关上下文则分别测基础能力与抗干扰性。这样能区分模型究竟在利用语义,还是简单匹配热词。

一套音频配多种上下文,控制声学变量

基准包含1859个测试组、3764个语义测试样例,覆盖中文和英文同音或近同音词。每组共享合成语音,让不同条件的声学输入保持一致,变化只来自上下文。另有训练与开发目标,用于适配模型,并严格检查目标词不会泄漏到隐式上下文中。

图2:论文说明测试组、语言划分与目标召回评测方法。

指标同时看字符/词错误率和目标词召回。前者反映整句转写质量,后者专门检查那个容易混淆的词有没有被识别出来。显式提示通常仍比隐式语义更强,说明直接提供热词依然有效;但隐式条件更接近连续对话助手的真实需求。

下一步:把上下文识别带进真实对话

对Qwen3-ASR-1.7B微调后,中文隐式上下文目标召回提高11.0个百分点,英文提高11.5个百分点。收益还能迁移到训练时排除的显式条件,并帮助中文真实录音的热词识别。与此同时,AISHELL-1和LibriSpeech上的CER/WER绝对变化都低于0.1个百分点。

图3:论文分析隐式上下文召回提升以及通用错误率变化。

这些结果并不表示所有语音场景都提升11个点。测试围绕特定同音词构造,主要音频还是合成语音,口音、噪声、多人对话和长历史仍需单独验证。它提供的关键工具是可控评测:语音助手如果要“理解前文”,就应在不泄漏目标词、不牺牲通用转写的前提下,真正利用语义上下文纠正歧义。产品落地还要规定保留多长对话历史、如何处理无关话题,以及怎样在提升召回时避免把敏感旧信息错误带入当前转写。

真实录音中的口音、回声和多人抢话也应成为下一轮基准重点。

参考资料

https://arxiv.org/abs/2609.18680

https://arxiv.org/html/2609.18680

https://github.com/OPPO-Mente-Lab/HearInContext