Multimodal Chain of Continuous Thought for Latent-Space Reasoning in Vision-Language Models
机构 * Harvard Medical School, Harvard University(哈佛医学院、哈佛大学) ; Athinoula A. Martinos Center for Biomedical Imaging, Massachusetts General Hospital(阿提尼乌拉A.马丁努斯生物医学成像中心、麻省总医院) ; Knovel Engineering Lab, Singapore(Knovel工程实验室、新加坡)
专题命中 图文多模态 :multimodal(title,abstract);cross-modal(abstract);分类 cs.CV