arXivDaily arXiv每日学术速递 周一至周五更新

PAPERDAILY REPORTS

斯坦福MIT等用VR一周采集75小时数据,灵巧手只需1—2小时真机示范

arXiv 2608.15917 cs.AI · cs.CV · cs.RO

斯坦福大学、麻省理工学院和Scale AI联合提出SPD,把灵巧手的大规模操作数据采集放进VR仿真。5名操作者在一周内积累75小时多任务轨迹,模型预训练后,只用1—2小时真实演示微调,就能迁移到56自由度的双手灵巧机器人上。

平行夹爪只有开合两个主要状态,数据采集和动作表示相对简单。多指灵巧手同时控制手腕、手指和双臂,远程操作成本高,真人手部视频又需要经过姿态估计与动作重定向,手指接触和机器人关节约束会在转换中丢失。

人在VR里直接操纵虚拟机器人手

SPD让操作者戴上VR设备,在仿真环境中控制与目标机器人相同的手部结构。采到的动作天然处于机器人本体空间,不需要先估计真人骨骼,再把动作硬映射到机械手。仿真还允许快速更换物体、初始位置和任务,不占用昂贵真机。

操作者在仿真中完成多种双手与多指操作任务

操作者在仿真中完成多种双手与多指操作任务。

团队用5名操作者在一周内采集75小时数据,覆盖抓取、调整、插入、双手配合等多类操作。规模不算互联网级,却明显高于单个实验室逐条采真机演示的常见做法。预训练采用因果Transformer预测动作序列,使策略从历史观察中判断接触变化并连续控制手指。

短动作块和历史信息让控制更及时

灵巧操作需要迅速纠正滑动与偏差。一次预测很长的动作序列,执行效率高,却可能在物体已经移动后仍沿用旧计划;每次只预测一个动作,又容易产生抖动。SPD使用较短动作块,并保留一段观察历史,在反应速度和动作连续性之间折中。

SPD训练阶段利用仿真轨迹预训练,推理阶段结合短动作块和历史观察

SPD训练阶段利用仿真轨迹预训练,推理阶段结合短动作块和历史观察。

消融实验显示,历史条件和短动作块都对反应式控制有贡献。模型学到的不是某个物体的固定轨迹,而是手指接触、物体运动与下一动作之间的统计关系。仿真数据中的视觉和动力学仍与现实有差距,因此团队没有直接零样本部署,而是保留少量真机微调环节。

1—2小时真实演示完成最后一段迁移

真实平台具有双臂、双手和共56个自由度。团队针对每个现实任务收集1—2小时物理演示,再在SPD预训练权重上微调。与从零训练行为克隆策略相比,仿真预训练版本在受测真实任务上表现更好,说明虚拟本体数据可以提供可迁移的动作先验。

56自由度双手机器人在真实环境中执行插入、抓取和挂杯等任务

56自由度双手机器人在真实环境中执行插入、抓取和挂杯等任务。

这个结果不能理解为“仿真完全替代真机”。微调仍需要针对硬件摩擦、相机视角、关节误差和具体物体采样,实验也集中在受控桌面任务。SPD降低的是形成有效初始策略所需的真机数据量,而不是消除现实数据。

这套方法的关键成本也因此发生了转移。传统路线把大量时间花在维护真机、复位物体和保障操作者安全上,SPD则需要先建立足够可信的仿真场景,并确保VR控制方式不会诱导出机器人无法执行的动作。论文采用与目标机器人一致的虚拟本体,缩小了动作表示差异,但接触摩擦、软物体形变和传感器噪声依然难以完全复刻。

从数据效率看,75小时仿真预训练与每项任务1—2小时真机演示承担了不同角色:前者让模型见到更丰富的手指协调模式,后者负责把这些先验校准到具体硬件。实验支持的是这种“广泛虚拟练习加少量现实校准”的组合,而不是只靠一两小时数据从零学会灵巧操作。

SPD预训练与从零训练策略在真实灵巧操作任务上的结果对比

SPD预训练与从零训练策略在真实灵巧操作任务上的结果对比。

从实验室数据走向更大规模技能库

VR采集的优势是可以让多人并行,不必为每名操作者准备一套真机。后续若扩展更多手型、物体材质和失败恢复轨迹,同一批仿真技能可以成为不同灵巧机器人的预训练底座,再用少量本体数据完成适配。

真正进入仓储、装配和家庭场景,还需要处理仿真未覆盖的柔性物体、复杂触觉和安全约束。论文给出的更现实路径,是把昂贵的真实演示集中用于最后校准,把大量练习转移到可复制的虚拟环境。

参考资料

https://arxiv.org/abs/2608.15917

https://spd.bot