音频模型答对一道题,可能靠文字常识猜中,未必真正听懂声音。微软研究院、马里兰大学、伊利诺伊大学和MBZUAI团队提出AudioRubrics,为每个样本生成基于原始波形的评分表,并在训练中根据模型的新回答持续改写标准。
论文图1:静态结果奖励可能放过猜测,动态评分表同时检查答案和推理过程。
每组回答都会筛掉已经失去区分力的标准
训练开始时,评分表生成器读取音频和问题,为该样本提出细粒度判断项。策略模型生成一组推理轨迹后,生成器再依据这些新错误补充或调整标准;裁判模型逐项打分,无法区分好坏回答的条目被移除。
最终奖励由正确答案得分、评分表得分和抑制过长推理的惩罚共同组成,再用于GRPO更新。固定标准容易在模型学会后饱和,动态标准会继续追踪当前策略暴露的新弱点。
论文图2:评分表生成器、裁判和策略模型在每轮训练中形成闭环。
MMAU为78%,同规模模型中三项基准均领先
AudioRubrics在MMAU取得78.0%准确率,在MMAR为65.8%,MMSU为65.86%。论文称它在三项基准上都超过同规模开源或训练型基线;在MMSU感知划分上,比可比规模中最强基线高4.3个百分点。
论文图3:评分表权重为0.5时平均成绩最高,更强裁判带来更高结果,奖励随训练上升。
实验也给出边界。评分表奖励权重从0增加到0.5时平均准确率上升,继续提高到0.7或0.9后回落。过程标准太重,模型会优先满足解释格式,正确答案信号被削弱。过度思考惩罚同样存在中间最优点。
更强裁判带来更高分,也带来更高训练依赖
把评分表生成器和裁判从GPT-audio-1.5换成Gemini-3.1-Pro后,成绩更高。这说明方法的收益部分依赖外部强模型,训练成本与评分偏差不能从最终策略分数中直接看出。
论文测试的是三个研究基准,没有证明动态评分能稳定覆盖真实录音里的噪声、口音和开放问题。裁判生成的标准也不是人工标注的客观真值。AudioRubrics验证了过程奖励可以改善音频推理,但产品部署仍需独立的人类听测与安全评估。