arXivDaily arXiv每日学术速递 周一至周五更新

PAPERDAILY REPORTS

GPT-4o Audio只答对36%:新模型开始听懂语气和环境

作者:arXivDaily编辑部 arXiv 2609.22771 cs · cs.AI · cs.LG · cs.SD · eess · eess.AS · eess.SP

论文导读

Adobe Research、马里兰大学、OpenAI提出ParA-LLM,把语速、音高、口音、混响和背景噪声等22类特征放进同一套音频理解框架。6000题ParA-Bench中,GPT-4o-Audio约为36%,ParA-LLM总体达到43.53%,但不同子类仍由不同模型领先,转写之外的声音信息仍是明显短板。

听清句子,只覆盖了语音的一半信息

自动转写回答“说了什么”,却不一定知道声音怎样被说出。同一句话可以快或慢、响亮或轻柔,也可能带有鼻音、混响、远近变化和街道噪声。这些信息影响会议分析、语音助手和具身智能对场景的判断,但现有音频模型训练通常更重视文字内容。

论文整理出22类副语言和声学特征,分成说话者与表达、环境声学,以及需要同时判断两者的混合问题。ParA-Bench用6000道多选题检查模型是否能从音频中区分这些属性,而不是依赖转写文本猜答案。

图:左侧比较GPT-4o-Audio与ParA-LLM总体准确率,右侧展示同一音频问题的回答差异。

先学单个属性,再学联合判断

训练数据包含超过120万组音频问答。团队先让模型分别学习语速、音高、混响等单属性问题,建立每类声音线索;第二阶段再加入多属性问题,要求模型同时处理说话者、表达方式和环境条件。

数据流程从干净语音出发,叠加噪声与混响以覆盖不同声学环境,同时计算音高、语速等可控制标签。这样能大规模生成监督,但合成扰动与真实录音仍有差距,尤其是多人重叠、设备失真和不断变化的背景声。

图:干净语音经过噪声与混响增强,再生成单属性和多属性音频问答用于两阶段训练。

43.53%领先,但离“听懂人”还很远

ParA-LLM在ParA-Bench总体准确率43.53%,第二名Voxtral为38.80%。在说话者与表达子集上,它达到55.85%;GPT-4o-Audio在声学子集上仍以41.85%领先。论文摘要用相对GPT-4o-Audio高7.5个百分点概括主要结果。

模型还在MMAU-Pro Speech和MMAR Speech上分别提高1.13和7.49个百分点。不同子集的领先者并不相同,说明“副语言理解”不是一个单项能力。多选成绩也不能等同于开放式情绪识别、身份判断或临床诊断;论文验证的是所定义22类属性中的受控问答。

从基准属性走向连续声学场景

下一步需要把离散标签扩展到连续变化:一个人边走边说,距离、噪声和情绪会同时改变。更实用的系统还要给出时间定位,说明哪一段声音支持判断,并避免从口音或音色推断无关身份。还要在真实会议、电话、车载和户外录音中验证稳健性,因为这些场景常同时出现多人重叠、设备压缩、回声与突发噪声。评测也应区分“听到线索”和“据此推断身份”,给敏感属性设置清晰边界,并检查模型面对无法判断的声音时能否拒答,而不是补出一个看似确定的标签。ParA-LLM提供了数据、基准和训练顺序,使音频模型开始系统处理“怎么说”和“在哪里说”。

参考资料

https://arxiv.org/abs/2609.22771

https://arxiv.org/pdf/2609.22771

https://nishitanand.github.io/paralinguistic-understanding-llm/