Examining Vision Language Models through Multi-dimensional Experiments with Vision and Text Features
机构 * School of Data Science, University of Virginia(数据科学学院,弗吉尼亚大学)
专题命中 VLM训练与架构 :vision language model(title,abstract);VLM(abstract);分类 cs.CV
AI 大模型
视觉语言模型、视觉推理、视觉问答、图文理解和视觉 grounding。
机构 * School of Data Science, University of Virginia(数据科学学院,弗吉尼亚大学)
专题命中 VLM训练与架构 :vision language model(title,abstract);VLM(abstract);分类 cs.CV
机构 * IEEE Publication Technology Department(IEEE出版技术部)
专题命中 VLM训练与架构 :vision-language model(title,abstract);分类 cs.CV、cs.AI
Comments 14 pages, 7 figures
机构 * School of Computer Science, Carnegie Mellon University(计算机科学系,卡内基梅隆大学)
专题命中 VLM训练与架构 :vision-language model(title,abstract);分类 cs.CV
Comments Accepted by ICLR 2025. Project page: https://zhangce01.github.io/DeGF/
机构 * Handong Global University(-handong全球大学)
专题命中 VLM训练与架构 :vision-language model(abstract);VLM(abstract);分类 cs.CV、cs.AI、cs.LG
Comments Medical Image Computing and Computer-Assisted Intervention (MICCAI) ISIC Skin Image Analysis Workshop (MICCAI ISIC) 2025; 10 pages
机构 * ByteDance Seed(字节跳动种子)
专题命中 VLM训练与架构 :vision-language model(abstract);VLM(abstract);分类 cs.CV
Comments Bytedance Seed Technical Report
机构 * Tsinghua University(清华大学) ; Meituan(美团) ; Northeastern University(东北大学) ; Beijing University of Posts and Telecommunications(北京邮电大学) ; Meta AI ; Wuhan University(武汉大学)
专题命中 VLM训练与架构 :vision-language model(abstract);vision language model(abstract);分类 cs.AI
机构 * Gaoling School of Artificial Intelligence, Renmin University of China(中国人民大学北京校区人工智能学院) ; School of Artificial Intelligence, Wuhan University(武汉大学人工智能学院)
专题命中 VLM训练与架构 :vision-language model(abstract);分类 cs.AI
Comments Accepted by ICML 2025