VLM See, Robot Do: Human Demo Video to Robot Action Plan via Vision Language Model
机构 * New York University(纽约大学)
专题命中 GUI与屏幕智能体 :vision language model(title,abstract);VLM(title,abstract);分类 cs.CV、cs.AI、cs.LG
AI 大模型
视觉语言模型、视觉推理、视觉问答、图文理解和视觉 grounding。
机构 * New York University(纽约大学)
专题命中 GUI与屏幕智能体 :vision language model(title,abstract);VLM(title,abstract);分类 cs.CV、cs.AI、cs.LG
机构 * ETH Zurich, Switzerland(苏黎世联邦理工学院,瑞士)
专题命中 GUI与屏幕智能体 :vision-language model(abstract)
Comments Accepted at Conference on Robot Learning 2025