论文导读
英伟达推出NemotronLabs VoiceChat,把流式听、说、打断处理、反馈识别和工具调用放进统一语音架构。论文报告用户打断后的接管率为100%,短促反馈后恢复回答的比例为93%,工具选择F1达到82.5%,重点转向真实对话节奏。
NemotronLabs VoiceChat: An Open Full-duplex Speech-to-Speech Model with Tool Calling Capabilities
NemotronLabs VoiceChat:具备工具调用能力的开源全双工语音到语音模型
作者
Jagadeesh Balam, Travis Bartley, Edresson Casanova, Sanjay Chauhan, Chen Chen, Zhehuai Chen, Zijia Chen, Francesco Ciannella, Slyne Deng, Mikyas Desta, Harishchandra Dubey, Slim Essid, Nourchene Ferchichi, Boris Ginsburg, Mariana Graterol Fuenmayor, Negar Habibi, Kevin Hu, Anand Joseph, Viraj Karandikar, Myungjong Kim, Viacheslav Klimkov, Seelan Lakshmi Narasimhan, Lily Lee, Jason Li, Eileen Long, Ameya Mahabaleshwarkar, Aditya Malte, Adi Margolin, Sasha Meister, Valentin Mendelev, Oluwatobi Olabiyi, Ankita Pasad, Yifan Peng, Elena Rastorgueva, Jayda Ritchie, Jason Roche, Nikhil Srihari, Yuanhang Su, Yoshi Suhara, Viet Anh Trinh, Jinhan Wang, Piotr Zelasko, Hui Wang, Puhui Meng, Chaosen Zhang, Yunsheng Liu, Shawn Wang, Wenjing Li, Zhonglei He
发表机构
英伟达
展开完整论文资料
- 作者
- Jagadeesh Balam, Travis Bartley, Edresson Casanova, Sanjay Chauhan, Chen Chen, Zhehuai Chen, Zijia Chen, Francesco Ciannella, Slyne Deng, Mikyas Desta, Harishchandra Dubey, Slim Essid, Nourchene Ferchichi, Boris Ginsburg, Mariana Graterol Fuenmayor, Negar Habibi, Kevin Hu, Anand Joseph, Viraj Karandikar, Myungjong Kim, Viacheslav Klimkov, Seelan Lakshmi Narasimhan, Lily Lee, Jason Li, Eileen Long, Ameya Mahabaleshwarkar, Aditya Malte, Adi Margolin, Sasha Meister, Valentin Mendelev, Oluwatobi Olabiyi, Ankita Pasad, Yifan Peng, Elena Rastorgueva, Jayda Ritchie, Jason Roche, Nikhil Srihari, Yuanhang Su, Yoshi Suhara, Viet Anh Trinh, Jinhan Wang, Piotr Zelasko, Hui Wang, Puhui Meng, Chaosen Zhang, Yunsheng Liu, Shawn Wang, Wenjing Li, Zhonglei He
- 机构
- 英伟达NVIDIA
- AI 总结
- 该论文提出开源全双工语音到语音模型NemotronLabs VoiceChat,通过流式架构整合语音编解码、RNN-T转录和工具调用,在多项基准上实现低接管率、高响应质量及82.5%工具选择F1,证明全双工交互与外部工具可统一集成。
语音助手要解决的不是“能说”,而是轮到谁说
传统语音系统常把识别、文本推理和语音合成串成流水线。它可以把一句话变成回答,却很难处理现实对话里的重叠:用户可能在助手讲话时改口,也可能只说“嗯”“对”表示继续。若系统一律停下,会把反馈误判成抢话;若一律说完,又会显得无法打断。
VoiceChat采用全双工设计,让模型持续接收音频的同时生成语音,并显式学习不同交互事件。重点不是把每段声音都转成完整文字,而是判断当前信号是正式打断、短促反馈、环境噪声,还是需要继续等待的停顿。
图:英伟达公开模型材料概括VoiceChat的流式语音对话能力。
一套架构同时管对话节奏和外部工具
系统将语音理解、语言推理与语音生成连接在同一流式过程中。用户真正插话时,助手应立即让出话轮并转向新请求;用户只做后向反馈时,助手则短暂停顿或自然继续。论文用专门基准把这两类情况分开,避免只测转写准确率。
工具调用也被放进语音交互。模型需要从口语请求中判断是否调用工具、选择哪个工具并生成参数,然后把结果重新组织成语音回答。这样,查天气、搜索信息或执行操作不必先结束一轮对话再进入另一个系统。
图:论文架构图展示音频输入、对话建模、语音输出与工具调用的连接方式。
100%接管不代表复杂语音场景全部解决
在Full-Duplex-Bench 1.0中,论文报告用户打断后的接管率为100%;在包含后向反馈的测试里,93%的案例能恢复响应。工具选择F1为82.5%,说明模型已能判断不少调用意图,但选对工具只是第一步。
论文同时指出,工具参数准确率和端到端执行仍较薄弱。口语里的省略、纠正和代词会让参数更难抽取;背景噪声、多人说话、口音与网络抖动也可能改变真实体验。基准上的“接管”成功,还需要结合停止延迟、误停率和回答是否接得上来评价。
图:论文时间线示例呈现用户语音、模型响应与工具调用在同一轮中的关系。
落地关键:把打断权和执行权分开治理
面向客服、车载和无障碍场景,团队可以先开放自然打断,再逐步增加工具能力。打断只改变对话状态,风险相对可控;工具执行可能产生订单、消息或设备控制,应保留确认步骤、权限边界和可撤销记录。
后续评测需要覆盖更长对话与真实声学环境,并分别统计误判打断、忽略打断、恢复失败和参数错误。用户说“不是明天,是周五”时,系统不只要停下来,还要修改先前参数,而不是把两条指令并列执行。
真正自然的语音助手,不是永远抢先回答,而是知道什么时候说、什么时候停、什么时候只听。VoiceChat给出了把这些能力统一训练的路径;它距离可靠代理仍有执行环节要补,但已经把语音交互的竞争焦点从音色自然推进到对话控制。
参考资料
https://arxiv.org/abs/2609.21967
https://huggingface.co/nvidia/NVIDIA-NemotronLabs-VoiceChat-11B