论文导读
Meta Reality Labs、台湾大学、Meta FAIR等机构提出EmoRES,不重训语音模型,只调整内部情绪方向的共享部分和残差部分。它在两种语音骨干上改善客观指标,人工评测中听众正确识别目标主导情绪的比例相对提升最高35.0%。
一个情绪方向其实有两部分
情绪语音模型有时收到“愤怒”或“悲伤”指令,声音却仍接近中性。重新训练需要情绪标注录音和大量计算;向量转向则直接在冻结模型的内部表示上加一个方向,成本更低。传统方法把整条情绪向量统一放大,容易把“远离中性”和“朝向某种情绪”混在一起。
图:几何箭头把远离中性的共享方向与目标情绪残差分开。
团队发现,情绪方向可以拆成共享成分和残差成分:共享成分把语音从中性区域推开,残差成分决定它更像快乐、悲伤、愤怒还是其他目标。EmoRES分别控制两者,在保留基本表达力度的同时,加强目标情绪的专属方向。
冻结骨干,只在推理时推一下
EmoRES不更新IndexTTS-2或CosyVoice2的主干权重。系统先从内部表示估计共享方向和各情绪残差,生成时再设定两个强度。几何图中的公共箭头对应整体情绪化,分叉箭头对应不同目标情绪,这也是它比单旋钮方法更细的地方。
图:彩色散点显示不同情绪在残差分解后的聚类分布。
这种训练外控制适合已有语音服务:不用重新准备全部数据,也可按产品场景调节表达。但强度过高仍可能损害自然度或说话人相似性,因此参数需要在指定模型和情绪集合内校准。
35%是人工识别率的相对提升
在IEMOCAP上,EmoRES在两个骨干的四项客观情绪指标中都优于CoCoEmo。秩相关分别提高26.13和12.97个百分点,情绪命中率分别提高12.95和6.92个百分点。
图:多条曲线记录转向强度变化对情绪指标和保真度的影响。
人工评测中,听众正确识别主导目标情绪的比例相对提升最高35.0%,保真度相对提升最高17.3%,自然度成对比较中最高63.8%的听众偏好EmoRES。35%是特定模型与数据集上的最高相对提升,不是绝对增加35个百分点。
未来可控语音需要多维验收
客服、游戏角色和无障碍朗读不仅要“更有情绪”,还要保证文字准确、身份稳定和不过度表演。部署时应把目标情绪识别率、自然度、说话人相似度和不同语言表现一起评估,并限制极端强度。
下一步可把共享与残差控制扩展到连续情绪、混合情绪和语境变化,让一句话内部的表达随内容转折。若配合可解释的强度记录和人工试听,推理时向量控制有望成为比重训更轻量的情绪调音台。对外服务还要防止过强情绪改变语义重音,并给用户提供试听和撤回选项。