SpeakerLM: End-to-End Versatile Speaker Diarization and Recognition with Multimodal Large Language Models
SpeakerLM:基于多模态大语言模型的端到端多功能说话人辨识与识别
专题命中 其他VLM :multimodal large language model(title,abstract);分类 cs.AI
AI总结 SpeakerLM通过多模态大语言模型实现端到端的说话人辨识与识别,结合灵活的说话人注册机制,提升多说话人场景下的识别性能。
Comments Accepted by AAAI 2026