论文导读
小鹏机器人提出IronMind,用低成本头戴设备收集人类第一视角操作,不经人体骨架重定向就转成相机空间动作。预训练数据从250小时扩到1万小时后,6项未见真机任务的成功率达到55.0%;数字来自指定平台和协议。
先解决人手和机器人手不同构
人类视频很多,但人手关节、机器人手臂和相机位置都不同。直接套用人体姿态,误差会在重定向中放大。IronMind改成在相机坐标下学习“与物体的相对运动”,并用规则过滤、原子任务重标注和逐帧质量权重整理数据。这样做保留了拿、放、推等动作结构,又不要求每条人类轨迹都先映射到某一种机器人骨架。
图:项目概览把一万小时数据、清洗流程、预训练与真机部署放在同一条链路上。
规模扩大后出现未见任务跃迁
开环评测检查模型是否找对物体、理解交互位置与动作方向;真机评测则看它能否在新场景完成连续操作。论文观察到,250和500小时规模容易过拟合,到2000小时以上,多项能力才稳定增长。数据并非简单堆叠:团队还按场景、任务和质量重新组织,避免少数高频动作吞没长尾行为。
图:开环样例分别检查该与什么交互、在哪里交互和如何行动,避免只看最终成败。
55%是一个真机节点,不是通用结论
在6项没有出现在预训练真机数据中的任务上,1万小时版本平均成功率55.0%。论文同时报告从小数据到大数据的稳定增长,说明人类头戴视频可能先教给模型通用操作先验。不过,任务数量、物体种类、机器人硬件和执行时长都有限;面对更长任务或不同手型时,当前增益是否保留仍需复现。
图:真机结果随预训练小时数改善,同时保留成功率与任务进度两种指标。
应用会先落在低成本数据引擎
这条路线的现实价值,是把人类演示变成可规模化采集的预训练资源。下一步需要验证更多人员、设备和家庭环境的偏差,并把碰撞、误抓与中途失败纳入安全评测。只有数据扩展与真机稳定性同时成立,才可能实质减少昂贵的专用机器人演示。
数据工程还要回答“哪些一小时最有用”。一万小时中,重复的拿放动作、被遮挡的手部画面和错误示范价值不同。更合理的部署实验应同时比较总时长、有效动作覆盖和清洗成本,并记录每类新任务从预训练中获得多少收益。若模型在新物体上进步、在长流程中仍频繁中断,团队就需要补充恢复和记忆数据,而不是继续无差别扩大视频库。对个人采集者还应明确隐私授权,避免家庭环境中的人脸、屏幕与地址信息进入训练集。
这也意味着数据规模不能脱离数据治理单独作为成绩单。