Speech LLMs in Low-Resource Scenarios: Data Volume Requirements and the Impact of Pretraining on High-Resource Languages
低资源场景下的语音大语言模型:数据量需求及高资源语言预训练的影响
机构 * Department of Information Engineering(信息工程系) ; Center for Augmented Intelligence(增强智能中心)
专题命中 预训练与数据 :LLM(summary_cn,abstract);pretraining(title);large language model(abstract);language model(abstract)
AI总结 该研究针对低资源ASR任务,基于SLAM-ASR框架探究语音LLM的数据量需求,发现高资源语言预训练的投影器可缓解数据稀缺问题,并结合多语LLM在公开基准上验证性能,为相关研究提供方向。
Comments Accepted at Interspeech 2025. 5 pages, 2 figures, 3 tables