ReconVLA: Reconstructive Vision-Language-Action Model as Effective Robot Perceiver
专题命中 GUI与屏幕智能体 :grounding(abstract);分类 cs.CV
AI 大模型
视觉语言模型、视觉推理、视觉问答、图文理解和视觉 grounding。
专题命中 GUI与屏幕智能体 :grounding(abstract);分类 cs.CV
机构 * SJTU(上海交通大学) ; vivo AI Lab(vivo人工智能实验室)
专题命中 GUI与屏幕智能体 :grounding(abstract);分类 cs.AI