Semantic World Models
机构 * University of Washington(华盛顿大学) ; Sony AI(索尼人工智能)
专题命中 视觉问答 :vision-language model(abstract);vision language model(abstract);visual question answering(abstract);分类 cs.AI、cs.LG
AI 大模型
视觉语言模型、视觉推理、视觉问答、图文理解和视觉 grounding。
机构 * University of Washington(华盛顿大学) ; Sony AI(索尼人工智能)
专题命中 视觉问答 :vision-language model(abstract);vision language model(abstract);visual question answering(abstract);分类 cs.AI、cs.LG
专题命中 视觉问答 :vision-language model(abstract);grounding(abstract);分类 cs.CV、cs.AI
机构 * 1 School of Biomedical Engineering, Division of Life Sciences ; Medicine, University of Science ; Technology of China, Hefei, Anhui, 230026, P.R. China 2 Center for Medical Imaging, Robotics ; Analytic Computing \& LEarning (MIRACLE), Suzhou Institute for Advanced Research, USTC, Suzhou 215123, P.R. China 3 Jiangsu Provincial Key Laboratory of Multimodal Digital Twin Technology, Suzhou Jiangsu, 215123 4 State Key Laboratory of Precision
专题命中 视觉问答 :vision-language model(abstract);VLM(abstract);分类 cs.CV
Comments The code, checkpoints, and dataset are available at: https://github.com/Leevan001/MedReason-R1