VITA-Audio: Fast Interleaved Cross-Modal Token Generation for Efficient Large Speech-Language Model
机构 * Tencent Youtu Lab(腾讯优图实验室) ; Nanjing University(南京大学) ; Xiamen University(厦门大学)
专题命中 音频语音多模态 :cross-modal(title,abstract);multi-modal(abstract);分类 cs.CL、cs.AI;MLLM(comments)
Comments Training and Inference Codes: https://github.com/VITA-MLLM/VITA-Audio