加州大学伯克利分校、Google DeepMind和英伟达研究人员把Gemini Robotics On-Device部署到宇树Unitree G1上,只通过托管微调接口完成两轮闭环训练。三项实机操作的成功率分别升至100%、98%和96%。
训练过程没有访问模型权重、梯度、概率或损失函数。团队使用的方法CLIFT把机器人执行时得到的奖励反馈改写成普通监督学习样本,再提交给官方微调接口。
论文图1:当前策略先在真机上执行,再对动作片段打分并生成带优势标签的监督数据。
三项任务都要让G1边平衡边操作
测试包含物品装箱、瓶子插入杯架和双手传递盘子。第三项要求机器人单手拿起盘子、交到另一只手,再放到目标位置,对双臂配合和手指接触的要求最高。
G1配备双臂、灵巧手和两个头部RGB相机。策略每次给出未来1.6秒的动作片段,底层全身控制器负责保持平衡并执行关节指令。桌面虽然固定,机器人躯干和腿部运动仍会持续改变相机视角与接触位置。
论文图3:从左到右为物品装箱、插杯和双手传盘,难度逐步增加。
三项任务各收集2小时VR遥操作示范,团队另用100组人工偏好比较训练奖励模型。每轮CLIFT再执行100次实机轨迹;这些轨迹既用于统计当轮成功率,也会在重新标注后进入下一轮训练。
失败轨迹没有被整段丢弃
CLIFT先给每个动作片段预测执行质量,再从相似初始状态中寻找参照,把片段标成正优势或负优势。即使一次任务最终失败,其中抓取和接近目标的部分仍可能成为正样本;成功轨迹里的笨拙动作也可能得到负标签。
论文同时测试了只保留奖励最高30%完整轨迹的方案。简单任务中,两种方案都接近满分;双手传盘中,片段级方案达到96%,整条轨迹筛选约为84%。困难任务成功样本少,直接丢掉失败轨迹会一并损失其中可用的动作。
最难任务从53%升到96%
Gemini Robotics的初始监督微调版本在装箱、插杯和传盘上的成功率为93%、70%和53%。两轮CLIFT后分别达到100%、98%和96%,每个结果来自固定测试配置下的100次执行。
论文图5:Gemini Robotics与开放权重模型π0.5使用相同示范、奖励模型和实机预算,但最终上限差距明显。
同一流程也用于开放权重的π0.5。它在三项任务中分别从59%升至76%、50%升至56%、5%升至30%,仍低于Gemini Robotics。两种模型的架构、规模和预训练数据不同,实验无法把差距归因于某一个因素;论文只证明了狭窄接口并未阻止闭环改进。
训练后还出现了示范中没有的恢复动作。G1会先转动物体再抓取,也会在第一次插入失败后调整位置重试。
论文图6:机器人在装箱前重新调整抓取姿态,并在插杯失败后再次尝试。
接近满分仍是受控桌面实验
三项结果来自同一台G1、固定场景布局和受控桌面任务,不能写成通用人形机器人已经掌握复杂劳动。CLIFT每轮都需要大量真机执行,收集成本高,也可能带来硬件安全风险;团队只比较了一款开放权重模型。
论文展示的是一种适配闭源机器人基础模型的工程路径。产品端还要验证新场景、新物体、长期运行和异常状态下的稳定性,也要减少每轮依赖的实机试错数量。