DepthLM: Metric Depth From Vision Language Models
机构 * Meta ; Princeton University(普林斯顿大学)
专题命中 VLM训练与架构 :vision language model(title,abstract);VLM(abstract);分类 cs.CV
AI 大模型
视觉语言模型、视觉推理、视觉问答、图文理解和视觉 grounding。
机构 * Meta ; Princeton University(普林斯顿大学)
专题命中 VLM训练与架构 :vision language model(title,abstract);VLM(abstract);分类 cs.CV
机构 * CUNY Graduate Center(纽约大学研究生中心) ; Borough of Manhattan Community College(曼哈顿社区学院) ; The City College of New York(纽约城市学院)
专题命中 VLM训练与架构 :vision-language model(title);vision language model(abstract);LLaVA(abstract);分类 cs.CV
机构 * Indian Institute of Technology Kharagpur(印度理工学院Khargapur分校) ; Max Planck Institute for Software Systems(马克斯·普朗克软件系统研究所)
专题命中 VLM训练与架构 :vision-language model(title);vision language model(abstract);分类 cs.AI
机构 * Nanyang Technological University(南洋理工大学) ; Nanjing University of Information Science and Technology(南京信息工程大学) ; Zhejiang University(浙江大学) ; South China Normal University(华南师范大学) ; Alibaba DAMO Academy(阿里巴巴达摩院) ; City University of Hong Kong(香港城市大学)
专题命中 VLM训练与架构 :vision-language model(abstract);VLM(abstract);分类 cs.CV
机构 * Department of Computer Science and Engineering, Southern University of Science and Technology(南方科技大学计算机科学与工程系) ; Department of Computer Science and Engineering, Hong Kong University of Science and Technology(香港科技大学计算机科学与工程系) ; School of Information and Control Engineering, China University of Mining and Technology(中国矿业大学信息与控制工程学院)
专题命中 VLM训练与架构 :vision-language model(abstract);分类 cs.CV、cs.LG
机构 * The Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳)) ; Harbin Institute of Technology, Shenzhen(哈尔滨工业大学(深圳))
专题命中 VLM训练与架构 :multimodal large language model(abstract);分类 cs.AI、cs.LG
机构 * McGill University(麦吉尔大学) ; Mila – Quebec AI Institute(魁北克人工智能研究所)
专题命中 VLM训练与架构 :vision-language model(abstract);分类 cs.CV、cs.LG
Comments Accepted to the 2025 MICCAI ELAMI Workshop
机构 * Rochester Institute of Technology(罗切斯特理工大学) ; Bosch Research(博世研究) ; DEVCOM Army Research Laboratory(美国陆军研究实验室)
专题命中 VLM训练与架构 :vision-language model(abstract);分类 cs.CV
Comments Accepted by EMNLP2025
机构 * Visual Recognition Group, Czech Technical University in Prague(捷克技术大学布拉格分校视觉识别组)
专题命中 VLM训练与架构 :VLM(abstract);分类 cs.CV
机构 * National University of Singapore(新加坡国立大学) ; Fudan University(复旦大学) ; Harbin Institute of Technology(哈尔滨工业大学) ; Eastern Institute of Technology(东方技术研究所)
专题命中 VLM训练与架构 :vision-language model(abstract)
Comments Accepted by ACM MM 2025