Patch-as-Decodable-Token: Towards Unified Multi-Modal Vision Tasks in MLLMs
机构 * South China University of Technology(华南理工大学) ; Institute for Infocomm Research (I 2 R), A*STAR(信息通信研究所(I 2 R),A*STAR) ; WeChat Vision, Tencent Inc.(微信视觉,腾讯公司) ; Foshan University(佛山大学) ; Nanyang Technological University(南洋理工大学) ; National University of Singapore(新加坡国立大学)
专题命中 多模态训练与对齐 :multi-modal(title);multimodal(abstract);MLLM(abstract);分类 cs.CV
Comments 24 pages, 12 figures and 9 tables