arXivDaily arXiv每日学术速递 周一至周五更新

PAPERDAILY REPORTS

清华&上海AI实验室等让机械臂预判传送带,抓取完成数从23次增至44次

作者:arXivDaily编辑部 arXiv 2608.20735 cs · cs.AI · cs.RO

传送带上的物体不会等机械臂想清楚再进入抓取区。清华大学、上海AI实验室、哈尔滨工业大学和云深处科技联合提出ForeTime-VLA,把世界动作模型看到的未来压缩成训练信号,部署时只看过去八帧。三档速度的实机测试中,它完成44/90次抓取,π0.5基线完成23/90次;高速档分别为11/30和2/30。

运行时没有未来帧,也不需要视频生成模型做一次完整前向计算。新增模块只有125.1万参数,论文测得延迟成本为2.46%至2.93%。

动态抓取难在接触时间而非物体类别

静止桌面上的抓取可以根据当前画面慢慢逼近,传送带任务还要判断物体何时进入可达范围、夹爪何时闭合、接触瞬间手腕朝向是否正确。ForeTime-VLA的数据覆盖静态抓取、移动跟踪、边走边抓和并发抓取四类场景;团队用去重后的传送带数据训练,在每个划分中匹配7.68万个窗口,避免重复片段让离线指标虚高。

论文数据图:数据集覆盖四类抓取场景,并统计场景规模、数据划分与传感器构成。

世界动作模型在离线阶段同时观察当前和八个未来偏移,把视频潜变量压成64维目标。学生模型只读此前八帧,预测四个未来Token、一个阶段Token和距离阶段切换的归一化时间。

把“未来结构”同时送进慢快两条路径

π0.5包含较慢的视觉语言路径和较快的动作专家。ForeTime-VLA把未来与阶段Token放进视觉语言前缀,同时让预测的未来代码和转场时间影响动作专家。训练仍保留原有流匹配动作目标,再加入余弦对齐、关系几何、阶段分类、切换时间和动作等价等损失。

论文Figure 1:教师离线读取未来帧,学生部署时只根据八帧历史预测紧凑未来代码。

这套设计没有用教师生成的新动作替换真实记录动作,减少“收益来自伪标签变化”的混淆。40k步检查点上,测试MAE从0.134119降至0.130593,下降2.63%;测试L2下降3.02%。变化不大,但成对自助法给出的MAE改善95%置信区间为0.82%至4.48%。

实机差距集中在传送带提速后

论文Figure 5:机械臂抓取移动物体时,系统同步预测接近、抓取、搬运和放置阶段。

静止任务成功率为81.1%,比次优参考高12.2个百分点;慢速移动任务为58.9%,高22.2个百分点。把三档速度合并,ForeTime-VLA完成44次,π0.5完成23次。作者把提升与更少的接触姿态错误联系起来,离线端手腕姿态误差的改善也与此一致。

论文Figure 4:三档传送带速度下,各方法30次试验的成功抓取数量。

每种方法、任务采用90次实机试验,数量比单段演示可靠,但仍是一套传送带、固定物体与相机配置。高速档11/30说明预判没有解决全部动态抓取问题。

下一步走向更杂乱的连续生产线

作者将方法定位为无需部署世界模型的未来知识蒸馏。后续需要测试多物体遮挡、速度突变、不同机械臂和更长的取放流程,并确认64维未来代码能否跨场景复用。若阶段预测在这些条件下仍能保持,仓储分拣和流水线拾取可以用较小部署开销获得提前量。

训练配置中,未来代码同时监督点对点余弦距离与样本间关系,目的是避免学生只记住一个平均向量。阶段与切换时间属于辅助任务,帮助模型区分接近、抓取、搬运和放置,而不是直接替代动作损失。

离线改善主要集中在末端执行器的滚转、俯仰和偏航。验证集姿态MAE改善4.12%,测试集改善1.03%。幅度在测试集变小,因此论文用实机接触姿态失败下降作为另一条证据,而没有把离线误差变化写成充分证明。

设备端还要考虑传送带视觉延迟。八帧历史本身跨越一段时间,相机帧率、控制频率和网络排队若改变,学到的“还剩多久接触”也会偏移,跨工厂部署需要重新测量同步误差。

参考资料

https://arxiv.org/abs/2608.20735

https://arxiv.org/html/2608.20735

https://arxiv.org/pdf/2608.20735