arXivDaily arXiv每日学术速递 周一至周五更新

PAPERDAILY REPORTS

康奈尔用超声眼镜读取无声说话,词汇量扩到5356个

arXiv 2608.00803 cs.HC · cs.LG · cs.SD

康奈尔大学发布SoniSpeech,用带超声传感器的眼镜采集无声说话时的面部运动。数据集包含34小时、18000条话语和5356个独立单词,基线模型在开放词汇无声语音识别中的词错误率为26.3%。

以往可穿戴无声语音接口多限定少量命令。词汇扩展方案常需要在脸上贴电极或使用更显眼的设备。SoniSpeech把发射与接收组件放进眼镜,通过超声回波捕捉口周细微变化。

SoniSpeech眼镜硬件与超声回波信号

论文图1:眼镜发射超声并接收四通道差分回波,同时记录音频和正面视频。

一句话同时保留三种信号

每条样本包含超声回波、发声音频和正面视频,并覆盖正常发声与无声两种模式。音频为文本对齐提供监督,视频帮助研究口型变化,超声则是最终可穿戴识别的主要输入。

语料来自对话数据,包含当代英语口语、缩写和完整音素覆盖,不再局限于十几个固定指令。开放词汇设置要求模型组合音素输出未被单独设为命令的句子,难度高于封闭分类。

SoniSpeech语料统计与训练规模曲线

论文图2:数据展示音素、句长和未登录词分布,并比较训练会话增加后的表现。

26.3%的词错误率仍会影响连续使用

团队使用基于CTC的ResNet-34建立首个基线。无声模式开放词汇识别的词错误率为26.3%,即按标准编辑距离统计,平均仍有约四分之一单词涉及替换、遗漏或插入。

联合使用发声和无声数据训练,比只用无声数据更好;训练会话增加到140个时,性能曲线仍未完全饱和。数据规模继续扩大可能带来改善,但论文没有给出成熟输入法所需的低错误率。

SoniSpeech数据集与基线结果表

论文结果页:表格列出数据规模、训练配置以及发声和无声模式的词错误率。

当前数据主要来自单一说话者

论文明确把数据收集集中在一名说话者,以建立干净的大规模开放词汇基线。这有利于控制变量,却没有解决换用户后的面部结构、说话习惯和眼镜佩戴位置差异。

开放数据集让研究者可以复现实验,但SoniSpeech离消费产品还有用户泛化、实时延迟、功耗、隐私和环境干扰等问题。26.3%的结果证明任务已经可以量化研究,尚不足以说明眼镜能够稳定替代键盘或语音输入。

参考资料

https://arxiv.org/abs/2608.00803

https://doi.org/10.7298/xjjr-9m85