arXivDaily arXiv每日学术速递 周一至周五更新

PAPERDAILY REPORTS

作业帮提出Poly-InstructTTS,用自然语言控制1000多种语音情绪与风格

作者:arXivDaily编辑部 arXiv 2608.20387 cs · cs.AI · cs.CL

“压低声音,带一点犹豫,像在嘈杂房间里提醒同伴”,这类描述比“悲伤”“兴奋”标签复杂得多。作业帮提出Poly-InstructTTS,用开放自然语言同时控制情绪、风格、口音和副语言行为。团队从影视视听素材构建1000小时指令标注语料,覆盖1000多种细粒度情绪与风格。

项目提供音频演示和扩展测试集说明。训练数据严格限非商业学术研究;论文没有宣布完整模型权重公开,不能把可试听页面写成已经开源可部署产品。

影视语料先经过多模态清洗与描述

普通有声书和播客以中性朗读为主,难以覆盖耳语、尖叫、迟疑、回声或多人对话。Poly-InstructTTS从影视片段提取语音,依次做镜头与人脸处理、说话人关联、语音活动检测、质量筛选和属性描述,把上下文、说话人状态与声学表现整理成指令—文本—音频对。

论文数据管线:影视视频经说话人定位、语音切分、质量控制和指令标注形成训练对。

开放描述由多模态模型生成,再用规则做文本准确性检查。自动标注能扩大风格覆盖,也可能继承识别与描述误差。作者把数据处理脚本与自有语料复现区分开,外部研究者仍需在具备合法权限的音频上重建管线。

“思考Token”先拆属性,再生成语音Token

模型的GPT部分不需要提示音频作为输入,而是读取内容文本、自然语言指令和一组属性思考Token。Token显式表示性别、情绪强度、风格和口音等维度,随后预测离散语音Token;流匹配模块再注入参考音频中的音色,声码器输出波形。

论文Figure 1:指令与属性思考Token进入GPT,流匹配和声码器负责音色注入与波形生成。

把音色注入推迟到流匹配阶段,是为了减少参考音频自身风格与目标指令冲突。论文还设计说话人微调,只在指定说话人的数据上迁移指令控制,尽量保留角色音色。

细粒度表达提升伴随字错率上升

评测同时看字错率、声学参数遵循、描述风格遵循、角色保持,以及主观指令符合度、自然度和表现力。消融实验中,移除属性思考Token会降低主观分,冻结的外部指令编码器也没有带来稳定增益。

论文Table 2:Poly-InstructTTS与闭源、开源基线及消融版本在基础和扩展测试集上的对比。

说话人微调版本在角色保持和自然度上更好,基础版本的指令符合度更高。训练轮次增加时,声学参数、风格和角色指标持续改善,但字错率上升。极端情绪和副语言行为让发音偏离标准读法,表现力与可懂度需要按使用场景选择。

强噪声和回声条件下也存在弱点,论文判断问题更多来自流匹配声学阶段,而非GPT理解指令的路径。演示能证明系统产生了多样声音,尚不能代替盲测、跨语言测试和真实用户评价。

客观指标中,APS检查音高、语速等基础声学参数,DSD评价描述性风格,RP关注角色保持;主观测试再分别询问指令符合度、自然度和表现力。多组指标拆开后,可以看到“更像指定角色”与“更忠实执行任意指令”并不总是同步。

说话人微调只改变特定角色的适配方式,不代表系统已经获得任意声音的合法克隆能力。参考音频过短、带噪或风格强烈时,音色注入仍可能与文字指令冲突,论文的后置注入只能缓解,不能保证完全分离。

下一步补上稳定性与授权边界

作者计划改善复杂声学环境下的稳定性,并继续平衡表达强度与字词准确。面向有声内容、游戏角色或教育语音时,还要记录参考音频授权、说话人同意和合成标识。技术端可继续测试中文方言、跨语言指令和长篇一致性;产品端则要把“听起来更像角色”和“每个字都读对”分别设为可调目标。

长文本还会暴露段落级情绪漂移。当前演示以句段为主,产品需要在数分钟语音中保持人物设定,同时允许情绪随内容变化。可行的评测应记录跨句音色一致性、情绪转折位置和累计字错率,而非只对独立短句打分。

参考资料

https://arxiv.org/abs/2608.20387

https://arxiv.org/pdf/2608.20387

https://zhangjh915.github.io/PolyInstructTTS-demo/