EndoVLA: Dual-Phase Vision-Language-Action Model for Autonomous Tracking in Endoscopy
机构 * The Chinese University of Hong Kong(香港中文大学) ; Technical University of Munich(慕尼黑技术大学)
专题命中 GUI与屏幕智能体 :grounding(abstract);分类 cs.AI
AI 大模型
视觉语言模型、视觉推理、视觉问答、图文理解和视觉 grounding。
机构 * The Chinese University of Hong Kong(香港中文大学) ; Technical University of Munich(慕尼黑技术大学)
专题命中 GUI与屏幕智能体 :grounding(abstract);分类 cs.AI