arXivDaily arXiv每日学术速递 周一至周五更新

PAPERDAILY REPORTS

清华等让机器人边走边拿,四项实机任务成功率76.3%

作者:arXivDaily编辑部 arXiv 2609.12081 cs · cs.CV · cs.RO

论文导读

清华大学、Xspark AI、香港科技大学(广州)、香港大学提出MoPA,让移动机器人不必停稳后再伸手,而是在行进中持续观察和操作。四项真机任务平均完整成功率76.3%,比最强基线高12.5个百分点;实验仍是室内受控任务,尚未证明在人群和开放环境中同样可靠。

会走和会拿,合起来反而更难

固定机械臂只需关心桌面附近,移动机器人还要决定底盘往哪走。底盘移动会改变相机视角,机械臂伸出又可能遮挡目标;如果把导航和抓取分成两段,机器人常常走到一个“看得见却够不着”的位置。

MoPA把两件事放进同一个策略:机器人一边移动,一边根据目标和周围障碍调整机械臂。论文展示了水果收集、颜色匹配、跨桌搬运和从微波炉取物四类任务,动作不再是“走—停—抓”的固定节拍。

论文图:移动机械臂在多个室内任务中同时调整底盘位置与机械臂动作。

远处看全局,近处看手边

方法先用底盘视角理解房间、目标大致方向和可通行区域,再让靠近机械臂的观察聚焦物体、抓手和接触细节。可以把它理解为两双眼睛分工:一双负责“我该站在哪”,另一双负责“手该怎么伸”。

策略把两类观察与文字任务合并,输出底盘和机械臂的联合动作。训练时,系统会遮住与当前动作无关的视觉区域,减少模型被背景细节带偏;同时保留能影响移动或抓取的关键信息。

论文图:移动专家和操作专家分别处理全局与局部信息,再由联合动作头同时控制底盘和机械臂。

这种分工并不是把两个独立模型简单串联。底盘靠近目标时,机械臂已经在准备姿态;抓取受阻时,底盘也能微调位置。动作之间互相让路,减少停顿和错误站位。

四项真机平均成功率76.3%

真实实验统计“完整成功”,也就是机器人从初始位置出发,最终完成整项任务。MoPA四项任务平均达到76.3%,最强基线低12.5个百分点。不同任务难点不同:有的要求在多个物体间移动,有的要求穿过狭窄空间,还有的要在视角变化中保持目标跟踪。

论文图:四项真机任务的执行画面及完整成功率对比,MoPA在平均结果上领先。

数字说明联合控制比“导航完再操作”更适合连续任务,但样本量和场景范围仍有限。室内布局、机器人平台和物体类别都经过设计,76.3%不能直接代表商场、家庭或工厂中的长期表现。

下一步要让边走边拿也懂安全

这类策略可以用于仓库拣选、家庭取物和实验室搬运,尤其适合目标分散、需要频繁换位置的任务。下一步除了提高成功率,还要把行人避让、碰撞预测和失败恢复放进同一闭环。

部署时可以让学习策略负责提出动作,由独立安全控制器限制速度、力和可达区域。只有当机器人既能连贯完成任务,又能在突发情况下及时停下,“边走边拿”才真正比走走停停更实用。

参考资料

https://arxiv.org/abs/2609.12081

https://arxiv.org/html/2609.12081

https://mopa-policy.github.io/