VUGEN: Visual Understanding priors for GENeration
机构 * Meta Fundamental AI Research(Meta基础人工智能研究) ; FAIR at Meta(Meta的FAIR)
专题命中 VLM训练与架构 :vision-language model(abstract);VLM(abstract);分类 cs.CV
AI 大模型
视觉语言模型、视觉推理、视觉问答、图文理解和视觉 grounding。
机构 * Meta Fundamental AI Research(Meta基础人工智能研究) ; FAIR at Meta(Meta的FAIR)
专题命中 VLM训练与架构 :vision-language model(abstract);VLM(abstract);分类 cs.CV
专题命中 VLM训练与架构 :vision-language model(abstract);分类 cs.CV、cs.AI
Comments Accepted to AAAI 2025
机构 * Université Paris Cité(巴黎Cité大学) ; University of Oxford(牛津大学) ; University of Turin(都灵大学) ; Universität Leipzig(莱比锡大学) ; Max Planck School of Cognition(马克斯·普朗克认知科学学院)
专题命中 VLM训练与架构 :vision-language model(abstract);分类 cs.CV、cs.AI
机构 * CUHK(香港中文大学) ; HKUST(香港科技大学) ; HKU(香港大学) ; ByteDance Inc(字节跳动公司)
专题命中 VLM训练与架构 :VLM(abstract);分类 cs.CV