VGGSounder: Audio-Visual Evaluations for Foundation Models
VGGSounder:基础模型的音视频评估
机构 * Technical University of Munich, MCML(慕尼黑技术大学,MCML) ; University of Tübingen(图宾根大学) ; Tübingen AI Center(图宾根人工智能中心) ; MPI for Intelligent Systems, ELLIS Institute(智能系统Max Planck研究所,ELLIS研究所)
AI总结 针对VGGSound数据集在音视频基础模型评估中的标签不完整、类别重叠和模态错位等问题,提出重新标注的多标签测试集VGGSounder,并引入模态混淆指标分析模型性能退化。
Comments Proceedings of the IEEE/CVF International Conference on Computer Vision (ICCV) 2025