SpaceVLLM: Endowing Multimodal Large Language Model with Spatio-Temporal Video Grounding Capability
机构 * University of Science and Technology of China(中国科学技术大学) ; Renmin University of China(中国人民大学)
专题命中 视频多模态 :multimodal(title,abstract);MLLM(abstract);分类 cs.CV