arXivDaily arXiv每日学术速递 周一至周五更新

PAPERDAILY REPORTS

清华等让机器人把“未来画面”压成潜动作,延迟降低42.9%

作者:arXivDaily编辑部 arXiv 2608.24882 cs · cs.RO

机器人世界动作模型常在执行动作前生成未来画面,用视觉预测帮助控制,但完整视频分支会拉高推理延迟。清华大学、中科院自动化所、TARS Robotics、复旦大学等机构提出LAWA,把未来变化压缩成离散潜动作,推理时不再重建未来像素。

RoboCasa实验中,LAWA在少样本和全数据设置下平均成功率分别为65.6%和80.8%,比匹配的Fast-WAM基线高9.6和4.5个百分点;相对保留未来视频预测的Joint-WAM,单个动作块延迟从593.1毫秒降到338.5毫秒,降低42.9%。

未来意图不必是一段完整视频

Fast-WAM只根据当前观测直接输出动作,速度快,却在演示稀缺和分布外场景中更容易掉点。Joint-WAM同时预测未来视频和动作,控制表现更稳,但需要处理大量与操作无关的像素。LAWA居于两者之间:它预测会怎样移动和接触,却不要求生成纹理、光照等完整画面。

项目方法图:Fast-WAM直接动作、Joint-WAM生成未来观测,LAWA改为预测紧凑的未来潜意图。

团队先训练一个离散分词器,把视频中与操纵有关的变化编码成码本目标。无动作的第一视角视频也能用于预训练,因为分词器学习的是画面中的状态转移,不需要同步机器人控制信号。

潜动作与可执行动作一起去噪

推理时,模型从当前图像出发,同时去噪一段连续潜状态和一组可执行动作块。潜状态锚定到离散潜动作码本,结构化注意力允许动作分支读取逐步成形的未来意图,但不会看到真实未来观测。训练阶段的视频预测教师和辅助模块在部署时全部移除。

项目图:潜动作分词器从视频变化中提取操作意图,动作专家在推理时读取潜意图而非未来像素。

论文用两种干预确认控制器确实使用了潜动作。给潜状态加高斯噪声后,全数据RoboCasa成功率从80.8%降到52.2%;打乱时间顺序后为56.4%。如果潜动作只是训练装饰,这类推理时扰动不应产生如此明显的下降。

80.8%成绩来自同一套匹配实现

LAWA、Fast-WAM和Joint-WAM共享数据划分、训练步数和主要优化设置,但各自保留架构需要的分支与目标。少样本设置每项任务使用100条演示,约占训练轨迹的10%;论文还在更低比例、LIBERO-Plus零样本与真实机器人任务上测试。

项目结果图:LAWA在全数据和少样本RoboCasa上兼顾成功率,并把推理延迟压到Joint-WAM以下。

Fast-WAM延迟更低,为196.5毫秒,但成功率明显落后;LAWA并不是绝对最快方案,而是在Joint-WAM级别表现与Fast-WAM级别部署路径之间取折中。真实机器人部分覆盖的任务和试验数量有限,不能把仿真平均值直接等同于开放环境可靠性。

项目图:RoboCasa、LIBERO-Plus及真实机器人操作场景用于评估少样本、全数据和迁移表现。

从视频预训练扩展到真实操作

潜动作的直接价值,是让无动作第一视角视频也能参与预训练,再用较少机器人演示把状态转移映射到可执行动作。对于数据昂贵的真实机械臂,这比为每段视频同步采集控制指令更容易扩展。

论文标注代码和模型将发布,当前项目页主要提供图表与演示。后续要核验开放版本能否复现338.5毫秒延迟,并在摄像机变化、物体遮挡和更长任务中保持潜动作的时间顺序。若码本只记住常见操作,遇到新工具和新接触模式时仍需重新学习。

产品化时还要观察码本在什么时刻失效。潜动作虽然比像素视频紧凑,却也可能压掉细粒度接触信息;如果机器人面对透明物体、柔性材料或需要多次试探的任务,单个离散意图未必足够。可行的验证方式是把潜动作可视化、与真实动作片段对齐,并分别测量成功率、响应延迟和异常恢复次数。

参考资料

https://arxiv.org/abs/2608.24882

https://arxiv.org/html/2608.24882

https://getterupper.github.io/LAWA