论文导读
智元机器人、北京大学、中国人民大学、香港大学等机构联合提出ZETA,用14种保留机型研究视觉语言动作模型能否跨机器人迁移。仅在预训练中加入5%目标机型数据,平均任务进展就提高13.4个百分点,说明“完全没见过”和“预训练见过少量”必须分开报告;实验限于固定桌面、两指夹爪和受控任务。
换机器人时,过去的零样本定义混在一起
同一条“零样本迁移”结论,可能对应两种完全不同的训练历史。严格零样本要求目标机器人从未进入任何训练数据;预训练暴露型零样本则允许它在大规模预训练中出现,只是在后续任务训练阶段没有专门数据。
ZETA把任务、场景、相机和测试协议尽量固定,只改变机器人外观、结构或控制接口。基准在仿真和真实验证中共保留14种目标机型,并把变化分成外观、末端执行器、机械臂和完整机身四类。
图:论文图1区分严格零样本与预训练暴露型迁移,并列出四类研究因素。
四个因素分别控制,不让场景变化混进来
团队依次测试状态与动作如何表示、源机器人是否足够多样、辅助任务是否共同训练,以及目标机器人是否在预训练中出现。局部末端执行器坐标让策略关注夹爪相对物体的运动,减少不同机械臂全局坐标造成的差异。
评估设置同时包含仿真和真实机器人。后训练和测试场景保持匹配,避免把桌面材质、相机角度或任务难度的变化误当成机型迁移问题。
图:论文图3展示仿真与真实设置中的目标机型及四类变化。
机型多样性提高约18点,5%目标数据提高13.4点
实验显示,使用局部末端执行器状态与动作表示,跨机型迁移提高约15个百分点;增加源机型多样性提高约18点;加入辅助共同训练目标提高约7点。这些数字来自分别控制变量的受控比较,不应直接相加成总体收益。
图:论文图5比较单一源机型与512种源机型预训练在仿真和真实测试中的表现。
当目标机型预训练数据从零增加到5%时,平均任务进展提高13.4个百分点。曲线随后趋于平缓,显示少量目标暴露就会显著改变问题难度,也说明把两类零样本结果放在同一张排行榜上会误导比较。
图:论文RQ4结果展示目标机器人预训练数据比例变化时的平均任务进展。
向移动底盘和灵巧手扩展
当前任务使用固定桌面和两指夹爪,控制周期、工作空间和目标物也较受控。下一步需要测试移动底盘、双臂、灵巧手以及更长的操作流程,并把碰撞、安全停止和失败恢复纳入指标。
对机器人团队,更实用的报告方式是同时公开目标机型在预训练、任务训练和测试中的出现比例。硬件更换成本也应与成功率一起统计:如果5%数据仍需要大量真实采集,迁移优势要结合采集时长和人工标注成本判断。