MotionVLA: Injecting Geometric Motion into Vision-Language-Action Model
MotionVLA: 将几何运动注入视觉-语言-动作模型
机构 * Huazhong University of Science and Technology(华中科技大学) ; D-Robotics(大疆机器人) ; Wuhan University(武汉大学)
专题命中 VLA模型 :vision-language-action(title,abstract);action model(title);VLA(abstract,abstract_cn);分类 cs.RO
AI总结 提出MotionVLA,通过运动历史接口将过去视频窗口转换为紧凑的连续轨迹场令牌,解决长程操作中的几何漂移和时间线索碎片化问题,提升动作平滑性和执行效率。
Comments 17 pages, 8 figures