康奈尔大学发布SoniSpeech,用带超声传感器的眼镜采集无声说话时的面部运动。数据集包含34小时、18000条话语和5356个独立单词,基线模型在开放词汇无声语音识别中的词错误率为26.3%。
以往可穿戴无声语音接口多限定少量命令。词汇扩展方案常需要在脸上贴电极或使用更显眼的设备。SoniSpeech把发射与接收组件放进眼镜,通过超声回波捕捉口周细微变化。
论文图1:眼镜发射超声并接收四通道差分回波,同时记录音频和正面视频。
一句话同时保留三种信号
每条样本包含超声回波、发声音频和正面视频,并覆盖正常发声与无声两种模式。音频为文本对齐提供监督,视频帮助研究口型变化,超声则是最终可穿戴识别的主要输入。
语料来自对话数据,包含当代英语口语、缩写和完整音素覆盖,不再局限于十几个固定指令。开放词汇设置要求模型组合音素输出未被单独设为命令的句子,难度高于封闭分类。
论文图2:数据展示音素、句长和未登录词分布,并比较训练会话增加后的表现。
26.3%的词错误率仍会影响连续使用
团队使用基于CTC的ResNet-34建立首个基线。无声模式开放词汇识别的词错误率为26.3%,即按标准编辑距离统计,平均仍有约四分之一单词涉及替换、遗漏或插入。
联合使用发声和无声数据训练,比只用无声数据更好;训练会话增加到140个时,性能曲线仍未完全饱和。数据规模继续扩大可能带来改善,但论文没有给出成熟输入法所需的低错误率。
论文结果页:表格列出数据规模、训练配置以及发声和无声模式的词错误率。
当前数据主要来自单一说话者
论文明确把数据收集集中在一名说话者,以建立干净的大规模开放词汇基线。这有利于控制变量,却没有解决换用户后的面部结构、说话习惯和眼镜佩戴位置差异。
开放数据集让研究者可以复现实验,但SoniSpeech离消费产品还有用户泛化、实时延迟、功耗、隐私和环境干扰等问题。26.3%的结果证明任务已经可以量化研究,尚不足以说明眼镜能够稳定替代键盘或语音输入。