MIMO: A medical vision language model with visual referring multimodal input and pixel grounding multimodal output
Yanyuan Chen, Dexuan Xu, Yu Huang, Songkun Zhan, Hanpin Wang, Dongxue Chen, Xueping Wang, Meikang Qiu, Hang Li
机构
*
School of Software & Microelectronics, Peking University(软件与微电子学院,北京大学)
;
School of Computer Science, Peking University(计算机学院,北京大学)
;
National Engineering Research Center for Software Engineering, Peking University(软件工程国家工程研究中心,北京大学)
;
Peking University Sixth Hospital(北京大学第六医院)
;
Augusta University(奥古斯塔大学)
;
Peking University First Hospital(北京大学第一医院)