JavisGPT: A Unified Multi-modal LLM for Sounding-Video Comprehension and Generation
JavisGPT:一种用于声音-视频理解和生成的统一多模态大语言模型
机构 * ZJU(浙江大学) ; NUS(国立新加坡大学) ; HKUST(GZ)(香港科技大学(广州)) ; RUC(中国人民大学) ; HZCU(杭州电子科技大学) ; NTU(国立台湾大学) ; SMU(新加坡国立大学) ; USYD(澳大利亚悉尼大学) ; ANU(澳大利亚国立大学)
专题命中 视频多模态 :multi-modal(title);multimodal(abstract);MLLM(abstract);分类 cs.CV
AI总结 JavisGPT是一种统一多模态大语言模型,通过三阶段训练流程在声音-视频理解和生成任务中表现出色,尤其在复杂和时间同步场景中表现更优。
Comments Accepted by NeurIPS as a Spotlight paper. Code: https://github.com/JavisVerse/JavisGPT