DashCLIP: Leveraging multimodal models for generating semantic embeddings for DoorDash
机构 * DoorDash, Inc.(DoorDash公司)
专题命中 图文多模态 :multimodal(title);multi-modal(abstract);image-text(abstract)
AI 大模型
跨文本、图像、视频、音频等模态的大模型与学习方法。
机构 * DoorDash, Inc.(DoorDash公司)
专题命中 图文多模态 :multimodal(title);multi-modal(abstract);image-text(abstract)
机构 * Siebel School of Computing and Data Science(塞比尔计算与数据科学学院) ; University of Illinois at Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校)
专题命中 图文多模态 :image-text(title,abstract);分类 cs.CV
Comments Published in TMLR, with a J2C Certification
Journal ref Transactions on Machine Learning Research, 2025
机构 * Instituto Superior Técnico, Universidade de Lisboa(里斯本大学技术高级学院) ; Instituto de Telecomunicações(电信研究所) ; Carnegie Mellon University(卡内基梅隆大学) ; Sword Health(Sword健康) ; TransPerfect ; MICS, CentraleSupélec, Université Paris-Saclay(MICS,中央圣艾尔布里大学,巴黎萨克雷大学) ; ELLIS Unit Lisbon(里斯本ELLIS单位)
专题命中 图文多模态 :multimodal(abstract);image-text(abstract);分类 cs.AI
Comments 15 pages, 7 figures, submitted to arXiv October 2025. All models, datasets, and training code will be released at https://huggingface.co/collections/utter-project/towervision
专题命中 图文多模态 :multimodal(abstract);分类 cs.CV、cs.CL
Comments NeurIPS 2025
机构 * Adobe Research(Adobe研究院) ; University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) ; MIT(麻省理工学院)
专题命中 音频语音多模态 :multimodal(title);分类 eess.AS
Comments Submitted to ICASSP 2026
专题命中 音频语音多模态 :multimodal(abstract)
Comments in French language
Journal ref Corpus audiovisuels. Quelles approches ? Quels usages ?, Editions des archives contemporaines, 2022, 9782813003799
机构 * HKU Musketeers Foundation Institute of Data Science(香港大学数据科学学院) ; The University of Hong Kong(香港大学) ; DAMO Academy(达摩院) ; Alibaba Group(阿里巴巴集团)
专题命中 视频多模态 :multi-modal(title);cross-modal(abstract)
Comments Accepted at 39th Conference on Neural Information Processing Systems (NeurIPS 2025)
机构 * New York University(纽约大学) ; Stanford University(斯坦福大学)
专题命中 视频多模态 :multimodal(abstract);分类 cs.CV;MLLM(comments)
Comments Website: https://cambrian-mllm.github.io/
机构 * Kunming University of Science and Technology(昆明理工大学) ; Chongqing University of Post and Telecommunications(重庆邮电大学) ; China University of Mining Technology(中国矿业大学) ; Nanjing University of Science and Technology(南京理工大学)
专题命中 视频多模态 :cross-modal(abstract);分类 cs.CV
专题命中 视频多模态 :multimodal(abstract)
机构 * Columbia University(哥伦比亚大学)
专题命中 跨模态检索 :multimodal(title,abstract);MLLM(abstract);分类 cs.AI
机构 * Tsinghua University(清华大学) ; Xiaomi EV(小米电动车) ; Georgia Institute of Technology(佐治亚理工学院) ; National University of Singapore(新加坡国立大学) ; The Chinese University of Hong Kong(香港中文大学) ; Renmin University of China(中国人民大学)
专题命中 跨模态检索 :cross-modal(title,abstract);multimodal(abstract)
机构 * University of Birmingham(伯明翰大学)
专题命中 跨模态检索 :cross-modal(abstract);分类 cs.CV
Comments Accepted by TMLR 2025
专题命中 多模态生成 :multimodal(title,abstract);multi-modal(abstract)
机构 * Massachusetts Institute of Technology(麻省理工学院) ; Microsoft Research(微软研究院)
专题命中 多模态生成 :multimodal(title,abstract);分类 cs.AI、cs.MM
Comments Accepted to NeurIPS 2025, Conference on Neural Information Processing Systems, Workshop on Generative and Protective AI for Content Creation
机构 * University of New South Wales(新南威尔士大学) ; University of Sydney(悉尼大学) ; The University of Hong Kong(香港大学) ; University of Southern California(南加州大学)
专题命中 多模态生成 :multimodal(abstract);MLLM(abstract);分类 cs.AI
机构 * Department of Computer Science, Utah Valley University(计算机科学系,犹他谷大学) ; School of Education, Utah Valley University(教育学院,犹他谷大学)
专题命中 多模态生成 :multimodal(abstract);分类 cs.AI
机构 * Nanjing University of Posts and Telecommunications(南京邮电大学) ; Peng Cheng Laboratory(鹏城实验室)
专题命中 多模态生成 :image-text(abstract);分类 cs.CV
Comments Accepted by ACM MM 2025
机构 * Southwest Jiaotong University(西南交通大学) ; Southeast University(东南大学) ; Sichuan University(四川大学)
专题命中 多模态评测 :cross-modal(title,abstract);multi-modal(abstract);分类 cs.CV、cs.AI、cs.MM
机构 * Personalization Team, Walmart Global Tech(Walmart全球科技个性化团队)
专题命中 多模态评测 :multimodal(title,abstract);MLLM(abstract);分类 cs.AI
Comments Accepted by the 39th Conference on Neural Information Processing Systems (NeurIPS 2025) Workshop: Efficient Reasoning
专题命中 多模态评测 :multimodal(title,abstract);分类 cs.CV
Comments 10 pages, 2 figures
机构 * University of Washington(华盛顿大学)
专题命中 多模态评测 :multimodal(title,abstract);分类 cs.AI
Comments 24 pages, 15 figures
机构 * FAIR at Meta(Meta 的 FAIR)
专题命中 多模态评测 :multimodal(title,abstract);分类 cs.CV
Comments 10 pages, 6 figures. Accepted to NeurIPS Datasets & Benchmarks 2025
专题命中 多模态评测 :multimodal(title,abstract);分类 cs.CV
机构 * College of Computer Science and Software Engineering, Shenzhen University(深圳大学计算机科学与软件工程学院) ; College of Applied Technology, Shenzhen University(深圳大学应用技术学院) ; Laboratory for Artificial Intelligence in Design, Hong Kong(人工智能设计实验室(香港)) ; College of Big Data and Internet, Shenzhen Technology University(深圳技术大学大数据与互联网学院) ; College of Computer Science and Technology, Harbin Institute of Technology, Shenzhen, China(哈尔滨工业大学深圳学院计算机科学与技术学院)
专题命中 多模态评测 :multimodal(title,abstract)
Journal ref Proceedings of the IJCAI-25, 7598--7606 (2025)
专题命中 多模态评测 :multimodal(abstract);分类 cs.CV、cs.AI
Comments 14 pages, 7 Figures
机构 * New York University(纽约大学)
专题命中 多模态评测 :multimodal(abstract);分类 cs.CV;MLLM(comments)
Comments Project page: https://cambrian-mllm.github.io
专题命中 多模态评测 :multimodal(abstract);分类 eess.AS
Journal ref Biomedical Signal Processing and Control 113 (2026) 109047
机构 * Dept. of Electronic and Computer Engineering and the Data Driven Computer Engineering Research Centre, University of Limerick(电子与计算机工程系和数据驱动计算机工程研究中心,利默里克大学) ; Valeo Vision Systems(瓦莱欧视觉系统) ; Queen Mary University of London(伦敦女王大学)
专题命中 多模态评测 :multimodal(abstract);分类 cs.CV
机构 * Peking University(北京大学) ; Shanghai Jiao Tong University(上海交通大学) ; OriginHub Technology(OriginHub科技) ; Institute for Advanced Algorithms Research, Shanghai(上海先进算法研究所) ; Zhongguancun Academy(中关村学院)
专题命中 多模态评测 :multi-modal(abstract);分类 cs.CL
Comments Manuscript