QMAVIS: Long Video-Audio Understanding using Fusion of Large Multimodal Models
QMAVIS:利用大多模态模型融合实现长视频音频理解
机构 * National University of Singapore(新加坡国立大学) ; Nanyang Technological University, Singapore(南洋理工大学)
专题命中 长视频与时序推理 :long video(title,abstract);video understanding(abstract);分类 cs.MM
AI总结 QMAVIS通过融合大型多模态模型、大型语言模型和语音识别模型,实现了长视频音频理解,展示了在VideoMME数据集上38.75%的性能提升,并在其他数据集上表现出竞争力。