论文导读
英伟达、加州大学圣迭戈分校、南加州大学做出了一套通用机器人插装世界模型。它用90种几何形状不同的零件训练,面对没见过的测试零件时,零样本成功率达56%,无模型基线只有7%。这类能力直接对应高混线上频繁换件的应用难题。
每换一种零件,就重做一套策略
工业插装对对齐和接触非常敏感。专用策略在固定零件上可以很稳,但零件的孔位、轮廓或入口方向变了,原有策略往往就得重新采数据、重新训练。高混线上的产品批次多、数量小,这套流程很容易把部署成本拉高。
团队没有让机器人去记住每个零件的固定动作,而是学一个“动一下之后会发生什么”的模型。输入包含机械臂自身位姿和腕部深度相机画面,输出是下一步末端位姿变化。
图:Figure 3展示腕部深度观测、机械臂本体信息与通用世界模型的数据流。
90种训练件,10种零件留到最后再见
数据集包含100种插装组件,其中90种用于训练,10种保留为未见测试对象。这些零件有不同底座、插杆和孔位,模型必须从当前深度画面判断应该往哪个方向修正,不能直接调用已知零件的动作模板。
图:Figure 2列出不同几何结构的插装件,训练与留出测试来自同一数据分布。
在未知几何形状的留出零件上,世界模型方法的零样本成功率是56%,无模型基线为7%。训练中纳入的零件越多,对留出零件的表现也随之提高,说明它学到的不只是某一个工件的路径。
未来落地:通用模型也要少吃数据
团队还把通用模型放到留出零件上微调,再与从头训练的专用模型比较。结果显示,通用模型的数据效率更高,在部分零件上的最终表现也更好。世界模型先从多种形状中学到通用的对齐与接触规律,到新零件上只需补少量专用数据。
图:多组留出零件上,红色微调曲线与蓝色从头训练曲线呈现不同的学习速度和最终表现。
这个56%仍然来自论文指定的插装任务和同分布留出零件,不等于机器人可以直接处理任意工业零件。下一步更关键的是扩展几何、材料、公差和真实生产节拍,看通用性能否继续保持。
对工业现场而言,这项工作的直接价值不是把56%当作可上线指标,而是把新工件适配从“重新训练一套策略”改写为“先复用通用模型,再补少量数据”。真正的落地门槛还包括毫米级公差、接触力限制、传感器噪声和连续失败后的安全恢复。论文目前主要依赖腕部深度观测,尚未证明在反光金属、透明件或严重遮挡下也能保持同样优势,因此后续评测需要把这些高频生产变量纳入测试。