arXivDaily arXiv每日学术速递 周一至周五更新

PAPERDAILY REPORTS

英伟达让机器人记住过去,动态叠杯20次成功19次

作者:arXivDaily编辑部 arXiv 2610.10528 cs · cs.AI · cs.CV · cs.RO

论文导读

英伟达、麻省理工学院、香港大学等机构提出Long-WAM,让机器人利用过去的观察预测后续画面,再生成动作。在宇树G1的动态叠杯测试中,模型20次成功19次,两种对照方法均未成功。研究重点是让机器人在当前画面之外,继续利用先前的操作记录。研究团队还把视频预测和动作执行安排成重叠流程,在保留未来预测的同时缩短机器人等待时间。

移动杯子,不能只看一张照片

传送带上的杯子不断移动。机器人看到当前画面后,还要判断目标运动方向、自己做到哪一步,以及下一次抓取应该落在哪里。把历史画面加进输入,可以提供这些线索,但画面多了,处理时间也会增加。

Long-WAM同时调整模型训练与执行流程。研究团队先让视频模型根据过去预测未来,再把这种时间顺序保留到机器人动作学习中。模型读取历史观察,生成未来画面的内部表示,动作部分利用过去和预测的未来制定接下来的一段操作。

作者对比发现,能访问历史和真正利用历史是两回事。双向预训练的初始化在增加上下文后没有得到净收益;采用按时间顺序预测的预训练方式,长历史才更明显地转化为任务表现。

图:视频预训练与历史观察动作预测流程(Figure 1)。

一边编码新观察,一边执行上一段动作

机器人不必等一整段操作结束,再从头处理所有视频。系统在新观察到达时逐步编码,把推理和机械动作安排成重叠执行,并复用可以保留的计算结果。

这套优化包括共享部分视频与动作计算,并针对设备选择计算实现。最终配置在RTX 5090上生成一段动作和未来视频内部表示需107.4毫秒;DGX Spark和Jetson AGX Thor上的测量分别为328.2和378.7毫秒。

这些数字对应论文固定配置,不能理解成任意历史长度都维持同样延迟。在RTX 5090的上下文扫描中,历史从2.4秒增长到19.2秒时,延迟由107.4毫秒升至341.0毫秒。更长记忆带来的任务收益,要和实际控制所能承受的等待时间一起评估。

动态叠杯,20次完成19次

实机任务要求G1拿起蓝杯,拦截传送带上的绿杯,再把绿杯放入蓝杯。Long-WAM成功率为95%;π0.5和Fast-WAM各20次测试均未完成这一组合任务。

连续画面能够区分“抓到一个杯子”和“完成叠杯”。对照可能已经拿起蓝杯,却错过移动绿杯。Long-WAM的展示则包含拦截、对齐与插入几个阶段,成功率统计对应最终任务完成。

图:蓝杯与移动绿杯的抓取和套叠序列(Figure 12)。

在RoboCasa GR-1仿真测试中,作者报告增加历史能把成功率从63.3%提升到78.7%。这一结果验证记忆对特定任务的价值,但并非所有任务都需要最长历史:LIBERO-Long的峰值出现在较短的2.4秒上下文。

系统还在YAM平台测试长期操作。分色积木、把饺子放入锅和叠碗分别进行20次,成功次数为16、16和17。不同物体和动作序列提供了另一组实机证据。

图:分积木、放饺子和叠碗的执行记录(Figure 16)。

未来应用:长记忆执行器,与高层规划分工

Long-WAM可以作为执行器,处理一段任务中的运动与接触过程。对于组合任务,高层规划负责决定接下来做什么,执行模型负责结合近期画面完成动作,两者的分工也在论文中得到测试。

部署时可以根据任务动态选择历史长度,而非一律保留最长窗口。传送带拦截需要快速更新,长序列操作可能更需要进度记忆。论文给出了设备延迟、上下文长度和成功率的独立测量,为这类配置提供可复核的依据。

参考资料

https://arxiv.org/abs/2610.10528

https://arxiv.org/html/2610.10528

https://arxiv.org/pdf/2610.10528

↑