arXivDaily arXiv每日学术速递 周一至周五更新

PAPERDAILY REPORTS

Meta不重训语音模型,只推一下内部向量,情绪识别率最高多35%

作者:arXivDaily编辑部 arXiv 2609.38157 cs · cs.CL · cs.SD · eess · eess.AS

论文导读

Meta Reality Labs、台湾大学、Meta FAIR等机构提出EmoRES,不重训语音模型,只调整内部情绪方向的共享部分和残差部分。它在两种语音骨干上改善客观指标,人工评测中听众正确识别目标主导情绪的比例相对提升最高35.0%。

一个情绪方向其实有两部分

情绪语音模型有时收到“愤怒”或“悲伤”指令,声音却仍接近中性。重新训练需要情绪标注录音和大量计算;向量转向则直接在冻结模型的内部表示上加一个方向,成本更低。传统方法把整条情绪向量统一放大,容易把“远离中性”和“朝向某种情绪”混在一起。

图:几何箭头把远离中性的共享方向与目标情绪残差分开。

团队发现,情绪方向可以拆成共享成分和残差成分:共享成分把语音从中性区域推开,残差成分决定它更像快乐、悲伤、愤怒还是其他目标。EmoRES分别控制两者,在保留基本表达力度的同时,加强目标情绪的专属方向。

冻结骨干,只在推理时推一下

EmoRES不更新IndexTTS-2或CosyVoice2的主干权重。系统先从内部表示估计共享方向和各情绪残差,生成时再设定两个强度。几何图中的公共箭头对应整体情绪化,分叉箭头对应不同目标情绪,这也是它比单旋钮方法更细的地方。

图:彩色散点显示不同情绪在残差分解后的聚类分布。

这种训练外控制适合已有语音服务:不用重新准备全部数据,也可按产品场景调节表达。但强度过高仍可能损害自然度或说话人相似性,因此参数需要在指定模型和情绪集合内校准。

35%是人工识别率的相对提升

在IEMOCAP上,EmoRES在两个骨干的四项客观情绪指标中都优于CoCoEmo。秩相关分别提高26.13和12.97个百分点,情绪命中率分别提高12.95和6.92个百分点。

图:多条曲线记录转向强度变化对情绪指标和保真度的影响。

人工评测中,听众正确识别主导目标情绪的比例相对提升最高35.0%,保真度相对提升最高17.3%,自然度成对比较中最高63.8%的听众偏好EmoRES。35%是特定模型与数据集上的最高相对提升,不是绝对增加35个百分点。

未来可控语音需要多维验收

客服、游戏角色和无障碍朗读不仅要“更有情绪”,还要保证文字准确、身份稳定和不过度表演。部署时应把目标情绪识别率、自然度、说话人相似度和不同语言表现一起评估,并限制极端强度。

下一步可把共享与残差控制扩展到连续情绪、混合情绪和语境变化,让一句话内部的表达随内容转折。若配合可解释的强度记录和人工试听,推理时向量控制有望成为比重训更轻量的情绪调音台。对外服务还要防止过强情绪改变语义重音,并给用户提供试听和撤回选项。

参考资料

https://arxiv.org/abs/2609.38157

https://github.com/facebookresearch/EmoRES-TTS

↑