arXivDaily arXiv每日学术速递 周一至周五更新

PAPERDAILY REPORTS

Gemini Robotics微调两轮,宇树G1三项任务最高成功率100%

arXiv 2607.29172 cs.AI · cs.RO

加州大学伯克利分校、Google DeepMind和英伟达研究人员把Gemini Robotics On-Device部署到宇树Unitree G1上,只通过托管微调接口完成两轮闭环训练。三项实机操作的成功率分别升至100%、98%和96%。

训练过程没有访问模型权重、梯度、概率或损失函数。团队使用的方法CLIFT把机器人执行时得到的奖励反馈改写成普通监督学习样本,再提交给官方微调接口。

CLIFT通过托管接口形成实机训练闭环

论文图1:当前策略先在真机上执行,再对动作片段打分并生成带优势标签的监督数据。

三项任务都要让G1边平衡边操作

测试包含物品装箱、瓶子插入杯架和双手传递盘子。第三项要求机器人单手拿起盘子、交到另一只手,再放到目标位置,对双臂配合和手指接触的要求最高。

G1配备双臂、灵巧手和两个头部RGB相机。策略每次给出未来1.6秒的动作片段,底层全身控制器负责保持平衡并执行关节指令。桌面虽然固定,机器人躯干和腿部运动仍会持续改变相机视角与接触位置。

Unitree G1的三项接触式操作任务

论文图3:从左到右为物品装箱、插杯和双手传盘,难度逐步增加。

三项任务各收集2小时VR遥操作示范,团队另用100组人工偏好比较训练奖励模型。每轮CLIFT再执行100次实机轨迹;这些轨迹既用于统计当轮成功率,也会在重新标注后进入下一轮训练。

失败轨迹没有被整段丢弃

CLIFT先给每个动作片段预测执行质量,再从相似初始状态中寻找参照,把片段标成正优势或负优势。即使一次任务最终失败,其中抓取和接近目标的部分仍可能成为正样本;成功轨迹里的笨拙动作也可能得到负标签。

论文同时测试了只保留奖励最高30%完整轨迹的方案。简单任务中,两种方案都接近满分;双手传盘中,片段级方案达到96%,整条轨迹筛选约为84%。困难任务成功样本少,直接丢掉失败轨迹会一并损失其中可用的动作。

最难任务从53%升到96%

Gemini Robotics的初始监督微调版本在装箱、插杯和传盘上的成功率为93%、70%和53%。两轮CLIFT后分别达到100%、98%和96%,每个结果来自固定测试配置下的100次执行。

两轮CLIFT前后各项任务成功率

论文图5:Gemini Robotics与开放权重模型π0.5使用相同示范、奖励模型和实机预算,但最终上限差距明显。

同一流程也用于开放权重的π0.5。它在三项任务中分别从59%升至76%、50%升至56%、5%升至30%,仍低于Gemini Robotics。两种模型的架构、规模和预训练数据不同,实验无法把差距归因于某一个因素;论文只证明了狭窄接口并未阻止闭环改进。

训练后还出现了示范中没有的恢复动作。G1会先转动物体再抓取,也会在第一次插入失败后调整位置重试。

闭环训练后出现的调整和重试动作

论文图6:机器人在装箱前重新调整抓取姿态,并在插杯失败后再次尝试。

接近满分仍是受控桌面实验

三项结果来自同一台G1、固定场景布局和受控桌面任务,不能写成通用人形机器人已经掌握复杂劳动。CLIFT每轮都需要大量真机执行,收集成本高,也可能带来硬件安全风险;团队只比较了一款开放权重模型。

论文展示的是一种适配闭源机器人基础模型的工程路径。产品端还要验证新场景、新物体、长期运行和异常状态下的稳定性,也要减少每轮依赖的实机试错数量。

参考资料

https://arxiv.org/abs/2607.29172

https://thomaschen98.github.io/clift/