arXivDaily arXiv每日学术速递 周一至周五更新

PAPERDAILY REPORTS

清华、中科院等给机器人视觉补上物理结构,零样本成功率最高87.8%

作者:arXivDaily编辑部 arXiv 2609.04193 cs · cs.RO

论文导读

中国科学院自动化研究所、清华大学、复旦大学、新加坡国立大学等机构提出GIFT,训练机器人策略时强制中间视觉特征保留几何、可操作区域和目标位置。三种配置在LIBERO-Plus零样本迁移中最高达到87.8%;实机结果覆盖论文设置的单臂、双臂操作,不代表任意机器人任务。

视觉信息很多,不代表对动作有用

机器人策略从图文预训练模型或视频世界模型获得丰富视觉特征,但控制动作只需要其中一部分。颜色、纹理和背景细节可能占据表示空间,真正决定能否抓取的物体几何、可接触区域和目标位置反而没有被稳定保留。团队把这种差距称为动作充分性缺口。

GIFT不更换策略输出方式,而是在训练时给中间视觉Token加三种结构监督:对齐几何、预测与指令相关物体的可操作区域、重建目标区域。辅助结果默认不直接输入动作头,只通过梯度改变特征。

图:论文图2展示几何、可操作区域和目标位置如何监督VLA与两类世界动作模型。

同一原则接到三种机器人策略

研究者分别把GIFT接入视觉语言动作模型、直接输出动作的世界动作模型,以及使用逆动力学的世界动作模型。每种模型保留原有动作定义,便于判断收益是否只来自某一特定架构。

LIBERO-Plus测试改变相机、机器人外观、语言表达、光照、背景、噪声和物体布局。三种GIFT配置达到79.6%、72.6%和87.8%,相对对应基线提高4.6、12.6和5.2个百分点。

图:论文图9展示单臂平台在旋转彩灯和更换桌面背景后的放置任务。

RoboCasa与实机都测试了结构迁移

在RoboCasa中,三种配置达到61.4%、83.6%和82.3%,分别高出对应方法12.6、9.0和8.4个百分点。真实平台包括xArm7单臂系统和ARX X5双臂系统,任务加入训练时未出现的光照、背景、物体和摆放变化。

87.8%是LIBERO-Plus某个配置的最高值,不能当作真实机器人通用成功率。论文还展示几何受噪声影响、可操作区域混淆干扰物和目标预测覆盖无关区域的失败例,说明结构监督仍依赖上游视觉质量。

图:论文图10展示双臂平台在更换背景物体和旋转试管架后的操作序列。

图:论文图1汇总GIFT与对应基线在七种分布变化下的成功率。

下一步把结构监督扩展为跨策略训练接口

GIFT的可复用点是训练约束,而非新增一套推理模块。后续可把触觉、接触力和物体状态加入中间监督,并检查辅助模型出错时是否会把错误结构写进策略。

真实部署还要覆盖更长任务和连续失败恢复。短程抓取或放置成功,并不保证机器人能在多步流程中发现物体滑落、重新规划并安全停机,这些能力需要独立数据和评测。

参考资料

https://arxiv.org/abs/2609.04193

https://openphoenix-team.github.io/GIFT-pages/