Test-Time Warmup for Multimodal Large Language Models
机构 * Columbia University(哥伦比亚大学)
专题命中 VLM训练与架构 :multimodal large language model(title,abstract);MLLM(abstract);分类 cs.AI、cs.LG
AI 大模型
视觉语言模型、视觉推理、视觉问答、图文理解和视觉 grounding。
机构 * Columbia University(哥伦比亚大学)
专题命中 VLM训练与架构 :multimodal large language model(title,abstract);MLLM(abstract);分类 cs.AI、cs.LG
机构 * Instituto Superior Técnico, Universidade de Lisboa(里斯本大学技术高级学院) ; Instituto de Telecomunicações(电信研究所) ; Carnegie Mellon University(卡内基梅隆大学) ; Sword Health(Sword健康) ; TransPerfect ; MICS, CentraleSupélec, Université Paris-Saclay(MICS,中央圣艾尔布里大学,巴黎萨克雷大学) ; ELLIS Unit Lisbon(里斯本ELLIS单位)
专题命中 VLM训练与架构 :vision-language model(title,abstract);分类 cs.AI、cs.LG
Comments 15 pages, 7 figures, submitted to arXiv October 2025. All models, datasets, and training code will be released at https://huggingface.co/collections/utter-project/towervision
专题命中 VLM训练与架构 :multimodal large language model(title,abstract)
机构 * Mila - Quebec AI Institute(魁北克人工智能研究所) ; Université de Montréal(蒙特利尔大学) ; Polytechnique Montréal(蒙特利尔理工学院) ; CIFAR AI Chair(CIFAR人工智能主席)
专题命中 VLM训练与架构 :vision-language model(abstract);VLM(abstract);分类 cs.CV
专题命中 VLM训练与架构 :grounding(abstract);分类 cs.CV、cs.LG
Comments NeurIPS 2025
专题命中 VLM训练与架构 :multimodal large language model(abstract);分类 cs.CV
机构 * DoorDash, Inc.(DoorDash公司)
专题命中 VLM训练与架构 :vision-language model(abstract);分类 cs.LG
机构 * School of Computer Science, Shanghai Jiao Tong University(上海交通大学计算机科学学院) ; Guangdong Laboratory of Artificial Intelligence and Digital Economy (SZ)(广东省人工智能与数字经济实验室(深圳))
专题命中 VLM训练与架构 :vision-language model(abstract);分类 cs.CV
Comments Accepted by NeurIPS 2025