MIMO: A medical vision language model with visual referring multimodal input and pixel grounding multimodal output
机构 * School of Software & Microelectronics, Peking University(软件与微电子学院,北京大学) ; School of Computer Science, Peking University(计算机学院,北京大学) ; National Engineering Research Center for Software Engineering, Peking University(软件工程国家工程研究中心,北京大学) ; Peking University Sixth Hospital(北京大学第六医院) ; Augusta University(奥古斯塔大学) ; Peking University First Hospital(北京大学第一医院)
专题命中 视觉定位与Grounding :vision language model(title,abstract);grounding(title,abstract);分类 cs.CV
Comments CVPR 2025