arXivDaily arXiv每日学术速递 周一至周五更新

PAPERDAILY REPORTS

AI陪聊也学会抢话:2000小时数据塞进打断、附和和环境声

作者:arXivDaily编辑部 arXiv 2609.12872 cs · cs.CL

论文导读

作业帮发布DuplexDrama,用合成流程构造包含打断、附和、说半句和环境声的双工语音数据,总音频超过2000小时,并计划开放6400段双语对话、合计800小时的子集。它补足真实交谈的重叠现象;但主体是合成语音,不能等同于真实用户分布与隐私风险已解决。

现实对话很少一人一句排队说

许多语音数据把对话切成干净轮次:A说完,B再说,中间没有重叠。真实聊天却会出现“嗯”“对”的附和,也会因误解而打断,背景里还有音乐、车辆和房间噪声。只在整洁数据上训练的助手,可能把附和当成新问题,或在用户尚未说完时抢答。

DuplexDrama把这些现象明确写进数据结构。每段对话不仅有文字和音频,还标记角色设定、场景、完整轮次、半双工行为与全双工事件,让模型能学到“什么时候继续听、什么时候短暂回应”。

论文PDF第1页:人物设定、对话文本、双向说话轨道与声学重叠标记共同组成一个样本。

四阶段流程把剧情变成多轨语音

数据先生成角色和场景,再写出符合人设的对话脚本。随后系统在脚本中插入打断、附和和不完整表达等双工行为,并为不同角色合成语音。最后,环境声与背景噪声被加入独立轨道,形成可控制的混合音频。

这种流程的好处是规模大、标签完整,而且能系统覆盖少见行为。研究者可以知道某个重叠是附和还是抢话,而不是从录音中事后猜测。代价是合成器、剧本模型和规则会把自身偏差带进数据。

2000小时与800小时开放子集不是同一概念

论文称完整构建规模超过2000小时。计划发布的精选子集包含6400段中英双语对话,总计800小时,使用64种音色和13类人物设定。两组数字分别对应内部生成总量与对外开放子集,不能混为“公开2000小时”。

论文PDF第4页:语料时长、类型、语言、说话者与背景声等统计,并与已有双工数据比较。

论文用自动语音识别、语音质量和对话行为相关指标评估数据与训练效果。实验意在证明双工事件能被学习,而不是宣称合成语音完全复刻真实人类交流。尤其是方言、情绪失控、多人对话和文化习惯,现有设置覆盖有限。

论文PDF第5页:模型在多种双工语音条件下的实验结果与分析。

下一步要把自然互动和安全一起测

这类数据可用于陪伴助手、教育对话和车载语音,让系统识别用户尚未说完、需要附和或希望被打断的时刻。下一步应加入真实用户自愿录制的小规模校准集,检查合成训练是否能迁移到不同口音、设备与噪声环境。

产品还必须提供明确的打断设置和可见状态,让用户知道麦克风何时工作,并允许关闭主动插话。双工能力不是“更会抢话”,而是更准确地区分倾听、附和、澄清和正式回答。

参考资料

https://arxiv.org/abs/2609.12872

https://arxiv.org/html/2609.12872