arXivDaily arXiv每日学术速递 周一至周五更新

PAPERDAILY REPORTS

桌面一变机器人就懵?新模型把成功次数从4次拉到17次

作者:arXivDaily编辑部 arXiv 2609.23863 cs · cs.RO

论文导读

西北大学、华盛顿大学、新加坡国立大学、微软提出Grounded Action Model,让机器人先把语言、点或框指定的目标变成带尺度的3D表示,再预测动作。在双臂YAM机器人视觉变化测试中,它20次成功17次,对照模型只成功4次。

机器人缺的不是看见,而是知道目标在哪里

视觉语言动作模型会把图像和指令直接映射成动作,但“把海绵放进碗里”同时包含目标身份、空间位置和当前机械臂状态。目标换位置、背景换颜色或桌面多出干扰物后,模型若只记住外观相关线索,动作很容易偏离。

GAM允许三种提示:一句语言、一个点或一个框。定位模块先找出被指定物体,再生成物体中心、尺度和局部视觉特征。机器人历史关节状态与这些目标令牌一起送入动作Transformer,输出一段连续动作,而不是每一步重新猜目标。

图:语言、点和框提示被转换成目标检测与三维几何令牌,再交给动作头控制机器人。

只看干净示范,也能应对随机场景

在RoboTwin 2.0的50项任务上,GAM平均成功率55.3%,Spatial Forcing为52.0%。更有差别的是场景随机化:GAM达到47.6%,Abot-M0为30.4%,而GAM的动作策略只用干净场景示范训练。

在LIBERO-PRO的16种扰动设置中,GAM平均61%,π0.5为53%。优势主要出现在目标被移动或重新指定时,这与模型显式保存“哪个物体、三维位置在哪里”的设计相符。结构图中的图像适配器和检测适配器分别保留外观与几何,再在条件融合层汇合。

图:二维框、图像特征、三维框和深度信息被编码后,与机器人状态共同生成动作块。

实机差距从4次扩大到17次

团队在双臂YAM机器人上改变视觉条件,同样做20次测试。GAM成功17次,π0.5成功4次。另一套Franka实验把GAM作为低层控制器,由Molmo2规划器按步骤给点提示;在长流程和需要记忆的任务中,分布内步骤完成率64.7%,分布外为49.8%。

这些数字分别来自特定机器人和实验设置,不能合并成一个通用成功率。它们共同验证的是控制接口:高层规划器可以持续更新目标点,低层策略利用三维几何完成当前动作,避免把整段任务塞进一个模糊的语言指令。

图:同一桌面任务在分布内与分布外场景中的原图,以及π0.5、MolmoAct2和GAM响应热图对比。

下一步是让3D定位适应真实噪声

真实部署会遇到遮挡、反光、深度估计误差和抓取过程中的目标漂移。GAM已经展示语言、点和框可以共用一套物体中心表示,也能与高层规划器组合。后续价值取决于定位误差能否被控制策略吸收,以及在更多机器人、更多相机和更长任务里保持稳定,还需要报告定位失败如何传导到动作失败。

参考资料

https://arxiv.org/abs/2609.23863

https://arxiv.org/pdf/2609.23863

https://grounded-action-model.github.io/