Region-Level Context-Aware Multimodal Understanding
机构 * Faculty of Computing, Harbin Institute of Technology(计算机学院,哈尔滨工业大学) ; Department of Computer Science and Technology, Harbin Institute of Technology(计算机科学与技术系,哈尔滨工业大学) ; Harbin Institute of Technology Suzhou Research Institute(哈尔滨工业大学苏州研究院长) ; Peng Cheng Laboratory, Shenzhen, China(鹏城实验室,深圳,中国)
专题命中 视觉定位与Grounding :multimodal large language model(abstract);MLLM(abstract);分类 cs.CV、cs.AI
Comments 12 pages, 6 figures