SD-VLM: Spatial Measuring and Understanding with Depth-Encoded Vision-Language Models
机构 * Zhejiang University(浙江大学) ; Westlake University(西湖大学) ; Alibaba Cloud Computing(阿里云 computing) ; Shanghai Jiao Tong University(上海交通大学)
专题命中 视觉问答 :VLM(title,abstract);vision-language model(title);vision language model(abstract);分类 cs.CV、cs.AI
Comments Accepted by NeurIPS 2025