DashCLIP: Leveraging multimodal models for generating semantic embeddings for DoorDash
机构 * DoorDash, Inc.(DoorDash公司)
专题命中 VLM训练与架构 :vision-language model(abstract);分类 cs.LG
AI 大模型
视觉语言模型、视觉推理、视觉问答、图文理解和视觉 grounding。
机构 * DoorDash, Inc.(DoorDash公司)
专题命中 VLM训练与架构 :vision-language model(abstract);分类 cs.LG
机构 * School of Computer Science, Shanghai Jiao Tong University(上海交通大学计算机科学学院) ; Guangdong Laboratory of Artificial Intelligence and Digital Economy (SZ)(广东省人工智能与数字经济实验室(深圳))
专题命中 VLM训练与架构 :vision-language model(abstract);分类 cs.CV
Comments Accepted by NeurIPS 2025