arXivDaily arXiv每日学术速递 周一至周五更新

PAPERDAILY REPORTS

英伟达把语音助手做成真对话:被打断100%接管,还能调用工具

作者:arXivDaily编辑部 arXiv 2609.21967 cs · cs.AI · cs.CL

论文导读

英伟达推出NemotronLabs VoiceChat,把流式听、说、打断处理、反馈识别和工具调用放进统一语音架构。论文报告用户打断后的接管率为100%,短促反馈后恢复回答的比例为93%,工具选择F1达到82.5%,重点转向真实对话节奏。

语音助手要解决的不是“能说”,而是轮到谁说

传统语音系统常把识别、文本推理和语音合成串成流水线。它可以把一句话变成回答,却很难处理现实对话里的重叠:用户可能在助手讲话时改口,也可能只说“嗯”“对”表示继续。若系统一律停下,会把反馈误判成抢话;若一律说完,又会显得无法打断。

VoiceChat采用全双工设计,让模型持续接收音频的同时生成语音,并显式学习不同交互事件。重点不是把每段声音都转成完整文字,而是判断当前信号是正式打断、短促反馈、环境噪声,还是需要继续等待的停顿。

图:英伟达公开模型材料概括VoiceChat的流式语音对话能力。

一套架构同时管对话节奏和外部工具

系统将语音理解、语言推理与语音生成连接在同一流式过程中。用户真正插话时,助手应立即让出话轮并转向新请求;用户只做后向反馈时,助手则短暂停顿或自然继续。论文用专门基准把这两类情况分开,避免只测转写准确率。

工具调用也被放进语音交互。模型需要从口语请求中判断是否调用工具、选择哪个工具并生成参数,然后把结果重新组织成语音回答。这样,查天气、搜索信息或执行操作不必先结束一轮对话再进入另一个系统。

图:论文架构图展示音频输入、对话建模、语音输出与工具调用的连接方式。

100%接管不代表复杂语音场景全部解决

在Full-Duplex-Bench 1.0中,论文报告用户打断后的接管率为100%;在包含后向反馈的测试里,93%的案例能恢复响应。工具选择F1为82.5%,说明模型已能判断不少调用意图,但选对工具只是第一步。

论文同时指出,工具参数准确率和端到端执行仍较薄弱。口语里的省略、纠正和代词会让参数更难抽取;背景噪声、多人说话、口音与网络抖动也可能改变真实体验。基准上的“接管”成功,还需要结合停止延迟、误停率和回答是否接得上来评价。

图:论文时间线示例呈现用户语音、模型响应与工具调用在同一轮中的关系。

落地关键:把打断权和执行权分开治理

面向客服、车载和无障碍场景,团队可以先开放自然打断,再逐步增加工具能力。打断只改变对话状态,风险相对可控;工具执行可能产生订单、消息或设备控制,应保留确认步骤、权限边界和可撤销记录。

后续评测需要覆盖更长对话与真实声学环境,并分别统计误判打断、忽略打断、恢复失败和参数错误。用户说“不是明天,是周五”时,系统不只要停下来,还要修改先前参数,而不是把两条指令并列执行。

真正自然的语音助手,不是永远抢先回答,而是知道什么时候说、什么时候停、什么时候只听。VoiceChat给出了把这些能力统一训练的路径;它距离可靠代理仍有执行环节要补,但已经把语音交互的竞争焦点从音色自然推进到对话控制。

参考资料

https://arxiv.org/abs/2609.21967

https://huggingface.co/nvidia/NVIDIA-NemotronLabs-VoiceChat-11B