Scaling Ambiguity: Augmenting Human Annotation in Speech Emotion Recognition with Audio-Language Models
缩放歧义:通过音频-语言模型增强语音情感识别中的人工标注
机构 * University of Melbourne(墨尔本大学) ; Xi'an Jiaotong University(西安交通大学)
AI总结 本文通过音频-语言模型生成合成标注,提升语音情感识别中模糊情感的真实分布可靠性,实验表明合成标注在低歧义区域效果显著,但高歧义情况需进一步优化。
Comments Accepted by ICASSP 2026