SALMONN-2: Advancing General-Purpose Hearing Abilities with Self-Supervised Representations
SALMONN-2:利用自监督表示提升通用听力能力
专题命中 音频语音多模态 :multimodal(abstract);分类 eess.AS
AI总结 研究探索自监督学习音频表示能否为音频大语言模型提供基础,提出基于统一SSL编码器的SALMONN-2,用多层特征融合适配器,还探索多模态上下文学习。实验表明通用SSL编码器性能良好,SALMONN-2达先进水平,且特定训练可获多模态上下文学习能力。
Comments Disclaimer: This work has been submitted to the IEEE for possible publication