EndoVLA: Dual-Phase Vision-Language-Action Model for Autonomous Tracking in Endoscopy
机构 * The Chinese University of Hong Kong(香港中文大学) ; Technical University of Munich(慕尼黑技术大学)
专题命中 VLA模型 :vision-language-action(title,abstract);action model(title);VLA(abstract);分类 cs.RO、cs.AI