The SLT 2026 SmartGlasses Challenge: Benchmarking Egocentric Multi-Talker Speech Recognition and Understanding with Audio-Language Models
2026 IEEE SLT智能眼镜挑战赛:基于音频-语言模型的自我中心多说话人语音识别与理解基准测试
机构 * Northwestern Polytechnical University(西北工业大学) ; Huawei(华为) ; AIShell Inc(AIShell公司) ; Shanghai Jiao Tong University(上海交通大学) ; Nanjing University(南京大学) ; University of Science and Technology of China(中国科学技术大学) ; Nanyang Technological University(南洋理工大学) ; Rokid
专题命中 音频语音多模态 :multimodal(abstract);分类 eess.AS
AI总结 本文介绍IEEE SLT 2026智能眼镜挑战赛,构建含714个真实场景会话的106小时四通道自我中心语音数据集,评估TSA-ASR与SLU,发现说话人重叠影响TSA-ASR性能、音频-语言模型难理解副语言声学。
Comments 7 pages, 7 figures