Said Aloud, Read Different: Cross-Modal Instability in Multimodal Models
语音与文本的不同解读:多模态模型中的跨模态不稳定性
机构 * Qatar Computing Research Institute, HBKU(卡塔尔计算研究所(哈马德·本·哈利法大学))
专题命中 音频语音多模态 :multimodal(title,abstract);cross-modal(title);multimodal foundation model(abstract);分类 cs.CL
AI总结 该研究针对多模态模型在语音与文本、英语与阿拉伯语间的判断一致性问题,构建含10150张图像的基准,发现模态与语言转换会引入未被整体准确率捕捉的不一致性,语音还会放大部分失败,且公开了该基准。
Comments Interpeech 2026