VLM4D: Towards Spatiotemporal Awareness in Vision Language Models
机构 * UCLA(美国大学洛杉矶分校) ; Microsoft(微软公司) ; UCSC(加州大学圣塔克拉拉分校) ; USC(美国大学洛杉矶分校)
专题命中 视觉推理 :vision language model(title,abstract);visual reasoning(abstract);grounding(abstract);分类 cs.CV、cs.AI
Comments ICCV 2025, Project Website: https://vlm4d.github.io/