TokLIP: Marry Visual Tokens to CLIP for Multimodal Comprehension and Generation
机构 * ARC Lab, Tencent PCG(腾讯PCG广告实验室) ; City University of Hong Kong(香港城市大学) ; Zhejiang University(浙江大学) ; NLPR & MAIS, Institute of Automation, CAS, Beijing(自动化研究所)
专题命中 图文多模态 :multimodal(title,abstract);分类 cs.CV、cs.CL、cs.AI
Comments Technical Report