When Vision-Language Model (VLM) Meets Beam Prediction: A Multimodal Contrastive Learning Framework
专题命中 VLM训练与架构 :vision-language model(title,abstract);VLM(title,abstract);grounding(abstract)
AI 大模型
视觉语言模型、视觉推理、视觉问答、图文理解和视觉 grounding。
专题命中 VLM训练与架构 :vision-language model(title,abstract);VLM(title,abstract);grounding(abstract)
专题命中 VLM训练与架构 :vision-language model(title,abstract);VLM(abstract);分类 cs.CV
机构 * Information Materials and Intelligent Sensing Laboratory of Anhui Province(安徽省信息材料与智能感知实验室) ; Anhui Provincial Key Laboratory of Multimodal Cognitive Computation(安徽省多模态认知计算重点实验室) ; School of Computer Science and Technology, Anhui University(安徽大学计算机科学与技术学院)
专题命中 VLM训练与架构 :VLM(title);vision-language model(abstract);分类 cs.CV
机构 * ByteDance(字节跳动)
专题命中 VLM训练与架构 :vision language model(abstract);VLM(abstract);分类 cs.CV、cs.AI
机构 * Netherlands Cancer Institute University of Amsterdam(荷兰癌症研究所 阿姆斯特丹大学)
专题命中 VLM训练与架构 :vision-language model(abstract);VLM(abstract);分类 cs.CV、cs.AI
Comments 10 pages, 2 figures, 2 tables, submitted at MICCAI IMIMIC workshop
机构 * AI Chip Center for Emerging Smart Systems(新兴智能系统人工智能芯片中心) ; The Hong Kong University of Science(香港科学大学) ; Zhejiang University College of Computer Science(浙江大学计算机科学学院)
专题命中 VLM训练与架构 :vision-language model(abstract);VLM(abstract);分类 cs.CV