论文导读
清华大学、Xspark AI、香港科技大学(广州)、香港大学提出MoPA,让移动机器人不必停稳后再伸手,而是在行进中持续观察和操作。四项真机任务平均完整成功率76.3%,比最强基线高12.5个百分点;实验仍是室内受控任务,尚未证明在人群和开放环境中同样可靠。
会走和会拿,合起来反而更难
固定机械臂只需关心桌面附近,移动机器人还要决定底盘往哪走。底盘移动会改变相机视角,机械臂伸出又可能遮挡目标;如果把导航和抓取分成两段,机器人常常走到一个“看得见却够不着”的位置。
MoPA把两件事放进同一个策略:机器人一边移动,一边根据目标和周围障碍调整机械臂。论文展示了水果收集、颜色匹配、跨桌搬运和从微波炉取物四类任务,动作不再是“走—停—抓”的固定节拍。
论文图:移动机械臂在多个室内任务中同时调整底盘位置与机械臂动作。
远处看全局,近处看手边
方法先用底盘视角理解房间、目标大致方向和可通行区域,再让靠近机械臂的观察聚焦物体、抓手和接触细节。可以把它理解为两双眼睛分工:一双负责“我该站在哪”,另一双负责“手该怎么伸”。
策略把两类观察与文字任务合并,输出底盘和机械臂的联合动作。训练时,系统会遮住与当前动作无关的视觉区域,减少模型被背景细节带偏;同时保留能影响移动或抓取的关键信息。
论文图:移动专家和操作专家分别处理全局与局部信息,再由联合动作头同时控制底盘和机械臂。
这种分工并不是把两个独立模型简单串联。底盘靠近目标时,机械臂已经在准备姿态;抓取受阻时,底盘也能微调位置。动作之间互相让路,减少停顿和错误站位。
四项真机平均成功率76.3%
真实实验统计“完整成功”,也就是机器人从初始位置出发,最终完成整项任务。MoPA四项任务平均达到76.3%,最强基线低12.5个百分点。不同任务难点不同:有的要求在多个物体间移动,有的要求穿过狭窄空间,还有的要在视角变化中保持目标跟踪。
论文图:四项真机任务的执行画面及完整成功率对比,MoPA在平均结果上领先。
数字说明联合控制比“导航完再操作”更适合连续任务,但样本量和场景范围仍有限。室内布局、机器人平台和物体类别都经过设计,76.3%不能直接代表商场、家庭或工厂中的长期表现。
下一步要让边走边拿也懂安全
这类策略可以用于仓库拣选、家庭取物和实验室搬运,尤其适合目标分散、需要频繁换位置的任务。下一步除了提高成功率,还要把行人避让、碰撞预测和失败恢复放进同一闭环。
部署时可以让学习策略负责提出动作,由独立安全控制器限制速度、力和可达区域。只有当机器人既能连贯完成任务,又能在突发情况下及时停下,“边走边拿”才真正比走走停停更实用。
参考资料
https://arxiv.org/abs/2609.12081