arXivDaily arXiv每日学术速递 周一至周五更新

PAPERDAILY REPORTS

佐治亚理工让机器人从失败中学习,叠杯成功率从40%升到90%

作者:arXivDaily编辑部 arXiv 2608.21204 cs · cs.LG · cs.RO

机器人模仿人类示范学会叠杯后,第一次操作失败通常不会让它自动变聪明:失败动作不能直接拿来继续模仿。佐治亚理工提出Q-Planning,冻结原有的数十亿参数行为克隆策略,只训练一个约10亿参数的价值函数。五轮实机自我改进后,叠杯成功率从40%升至90%,把钱包插入窄槽的成功率从25%升至80%。

系统没有给机器人补充新的人工示范。每次部署产生的成功和失败轨迹都进入回放池,Q函数学习判断哪些候选动作更可能通向成功;原有策略仍负责提出动作,权重始终不变。

模仿策略负责提案,Q函数负责挑选

行为克隆只能学习“该做什么”,不适合把失败动作当训练目标。Q函数学习的则是某个动作在当前状态下的长期价值,因此成功和失败轨迹都能提供信号。Q-Planning先用原策略训练时见过的成功示范训练Q函数,部署后再不断吸收机器人自己的操作结果。

论文Figure 1:冻结的行为克隆策略提出动作,Q函数打分,部署轨迹只更新Q函数。

每一步,策略采样32或64组动作片段,Q函数逐一评分,再用分数加权得到执行动作。视觉与语言编码器每步只计算一次,随候选数增长的主要是动作解码器。RoboTwin设置下单步规划约400毫秒,比一次10步行为克隆推理快1.6倍,能够落在960毫秒的重规划预算内。

十轮模拟改进把五组基准全部推高

论文在LIBERO的四套任务和47项RoboTwin任务上测试,所有成功率与回合长度均按每任务20次运行汇总。十轮在线改进后,LIBERO-10从93%升至99%,RoboTwin从83.8%升至91.4%;五组测试平均成功率从92.1%升至97.6%。在已经接近满分的任务上,改进更多表现为更短的成功回合。

项目页曲线:成功轨迹中的Q值逐步上升,失败轨迹保持在较低区间。

团队还与Best-of-N、只用成功轨迹的筛选式微调、IBRL、DSRL和DAWR比较。相同在线数据预算下,Q-Planning是其中唯一能持续利用失败信号、又不另训辅助策略的方法。它仍依赖二值成功标签:模拟环境自动给出,实机实验由人按回合标注。

两项双臂任务检验失败信号

论文实机任务:双臂机器人需要抓取并完成叠杯。

实机从100次基础部署开始,每轮继续采集100个回合,再只更新Q函数。叠杯五轮达到90%,而只拿成功轨迹做监督微调停在55%;插钱包达到80%,监督微调停在30%。两个任务都需要精确接触,失败轨迹包含“偏了一点”“卡在边缘”等成功示范不会展示的状态。

论文实机任务:机器人把柔性钱包插入狭窄收纳槽。

这些结果只覆盖两项实机任务,不能推出所有机械操作都能无人干预地自我训练。基础策略必须先能以非零概率提出可行动作;如果候选里从未出现成功方向,Q函数没有动作可以选。

下一步扩展到更大的动作边界

论文提出把其他动作提案器接入同一价值筛选框架,例如离线强化学习策略、奖励加权模仿策略或世界模型生成的动作。产品化还需要自动而可靠的成功判定,否则人工逐回合标注会成为新的瓶颈。另一个待测问题是更长任务:当前Q解码器成本随候选动作数量线性增长,扩大探索范围会直接增加延迟。

论文部署时在LIBERO使用64个候选动作,在RoboTwin使用32个。单个候选的Q解码约需2至3毫秒,数量翻倍会直接推高控制周期。作者还指出,多模态流匹配虽然比围绕单个高斯动作采样覆盖更宽,但探索范围仍由原策略决定。

真实系统还要处理奖励延迟和连续质量差异。当前任务用“整回合成功或失败”训练,无法区分差一点插入与完全抓错对象。若加入阶段奖励,需验证它不会把机器人引向得分高但不符合最终目标的捷径。

参考资料

https://arxiv.org/abs/2608.21204

https://arxiv.org/html/2608.21204

https://varungiridhar.github.io/qplanning/