arXivDaily arXiv每日学术速递 周一至周五更新

PAPERDAILY REPORTS

智元等提出τ0-VLA:用40115小时真实数据训练,机器人遇到难题可先多想几步

arXiv 2608.16885 cs.RO

上海创新研究院、智元Finch和香港中文大学联合提出τ0-VLA,让机器人在决定下一项子任务时按难度分配推理计算:简单步骤直接执行,困难或后果重要的步骤先生成多个候选,再借助世界模型比较。模型使用40115小时异构真实世界数据训练,并在多种机器人本体上执行长流程任务。

长任务的风险常出现在动作顺序,而不是单个抓取动作。机器人可以拿稳杯子,却可能在倒水前忘了放茶包;也可能完成眼前步骤,却把物体放到妨碍后续操作的位置。多数分层VLA模型每次只前向计算一次就选定下一子任务,没有机会在关键节点投入更多计算。

高层负责决定做什么,低层负责把动作做完

τ0-VLA将策略拆成高低两层。高层读取视觉、语言指令和执行记忆,生成“拿起番茄”“打开抽屉”一类子任务;低层VLA再把子任务转换成连续机器人动作。执行记忆记录已经完成的步骤和环境变化,减少长流程中的重复与遗漏。

τ0-VLA在做饭、整理和跨空间操作等长流程任务上的实机评测

τ0-VLA在做饭、整理和跨空间操作等长流程任务上的实机评测。

低层策略跨多种机器人本体共享,使高层计划不被某一套机械臂结构绑死。论文的物理机器人任务包括取放、准备食材和连续操作家居物品,也测试从通用预训练策略适配出的专用策略。这里展示的是研究环境中的闭环任务,不代表模型已经覆盖开放家庭中的任意物品与突发情况。

世界模型在关键决策前模拟后果

遇到不确定步骤时,高层策略会生成多个下一子任务候选。世界模型依据当前状态和候选动作预测后续观察,再由选择机制决定是否接受第一个方案或继续搜索。额外计算因此集中在真正可能影响整条任务的节点,而不是让每一步都固定运行同样次数。

系统结合执行记忆、高层候选搜索、世界模型判断和低层VLA执行

系统结合执行记忆、高层候选搜索、世界模型判断和低层VLA执行。

这种测试时计算与语言模型“多采样几个答案”类似,但机器人必须承担真实动作的不可逆后果。模型不能靠执行失败后无限重来,因此预测结果需要和当前物理状态绑定。论文用下一子任务准确率和闭环任务成功率分别检查计划判断与最终执行,避免只展示看起来合理的文字计划。

多想几步的收益在分布变化时仍然存在

实验覆盖同分布任务、视觉变化、物体变化和组合变化四种设置。加入世界模型引导的测试时计算后,下一子任务预测准确率在四种设置中都高于不搜索的策略;随着搜索计算增加,准确率先快速上升,随后趋于平台。

测试时计算在四种评测设置中获得最高的下一子任务准确率

测试时计算在四种评测设置中获得最高的下一子任务准确率。

这条曲线说明计算并非越多越好。候选达到一定数量后,继续搜索的边际收益下降,还会增加延迟。实际部署需要根据任务风险设置预算:整理桌面可以快速决策,涉及易碎物品、热源或多人协作时才扩大搜索范围。

论文使用的训练组合达到40115小时,来源包含大规模跨本体数据和针对具体机器人的数据。这个数字代表累计数据时长,并不等于40115小时连续真机自主运行。它的意义在于,高层规划可以从多种场景学习任务结构,低层控制再吸收具体硬件经验;两层分工让新增机器人不必从头重建全部长任务知识,但仍需针对相机、机械臂和夹爪做适配。

增加搜索计算后准确率先快速提高,随后逐渐接近平台

增加搜索计算后准确率先快速提高,随后逐渐接近平台。

下一步是让预测更懂真实物理代价

τ0-VLA证明了机器人基础模型也能利用可伸缩的测试时计算,但效果依赖世界模型能否预测接触、遮挡和物体状态。若预测器把“杯子已经抓稳”判断错了,高层再精细的搜索也会建立在错误状态上。

后续研究需要把碰撞风险、动作耗时和失败恢复一起放进候选评价,并测量额外计算带来的真实延迟。对仓储、实验室和家庭服务机器人而言,可审计的计划候选和风险分级,比单纯扩大模型参数更接近可控部署。

参考资料

https://arxiv.org/abs/2608.16885

https://tau0-vla.github.io/