DashCLIP: Leveraging multimodal models for generating semantic embeddings for DoorDash
机构 * DoorDash, Inc.(DoorDash公司)
专题命中 图文多模态 :multimodal(title);multi-modal(abstract);image-text(abstract)
AI 大模型
跨文本、图像、视频、音频等模态的大模型与学习方法。
机构 * DoorDash, Inc.(DoorDash公司)
专题命中 图文多模态 :multimodal(title);multi-modal(abstract);image-text(abstract)
机构 * Siebel School of Computing and Data Science(塞比尔计算与数据科学学院) ; University of Illinois at Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校)
专题命中 图文多模态 :image-text(title,abstract);分类 cs.CV
Comments Published in TMLR, with a J2C Certification
Journal ref Transactions on Machine Learning Research, 2025
机构 * Instituto Superior Técnico, Universidade de Lisboa(里斯本大学技术高级学院) ; Instituto de Telecomunicações(电信研究所) ; Carnegie Mellon University(卡内基梅隆大学) ; Sword Health(Sword健康) ; TransPerfect ; MICS, CentraleSupélec, Université Paris-Saclay(MICS,中央圣艾尔布里大学,巴黎萨克雷大学) ; ELLIS Unit Lisbon(里斯本ELLIS单位)
专题命中 图文多模态 :multimodal(abstract);image-text(abstract);分类 cs.AI
Comments 15 pages, 7 figures, submitted to arXiv October 2025. All models, datasets, and training code will be released at https://huggingface.co/collections/utter-project/towervision
专题命中 图文多模态 :multimodal(abstract);分类 cs.CV、cs.CL
Comments NeurIPS 2025