Scaling Audio-Visual Quality Assessment Dataset via Crowdsourcing
通过众包扩大音频-视觉质量评估数据集
机构 * College of Computing and Data Science, Nanyang Technological University(计算与数据科学学院,南洋理工大学) ; School of Information Science and Engineering, Shandong Normal University(信息科学与工程学院,山东师范大学) ; Institute of Information Science, Beijing Jiao Tong University(信息科学研究院,北京交通大学) ; YouTube Media Algorithms team, Google Inc.(YouTube媒体算法团队,谷歌公司)
专题命中 音频语音多模态 :audio-visual(title,abstract);multimodal(abstract);分类 cs.CV、cs.MM
AI总结 本文提出了一种通过众包扩大音频-视觉质量评估数据集的方法,通过设计实验框架、系统化数据准备和扩展标注,构建了最大的多样化AVQA数据集,用于多模态感知研究。
Comments Accepted to ICASSP 2026. 5 pages (main paper) + 8 pages (supplementary material)