Balancing ASR and diarization in end-to-end LLMs for multi-talker speech recognition
在端到端大语言模型中平衡ASR与说话人日志以进行多说话人语音识别
机构 * Huawei Technologies, China(华为技术有限公司)
AI总结 提出双编码器架构、特征交错格式、长度感知说话人ID损失和自适应阈值ASR损失策略,在有限真实数据下高效训练LLM系统,平衡ASR与说话人日志任务,在AliMeeting和Aishell4语料库上分别实现18%和24%的相对改进。
Comments Accepted in Interspeech 2026