东京大学、字节跳动Seed、香港大学、上海交通大学和清华大学团队发布SiMDex。它没有扩大机器人模型,也没有增加训练数据量,而是从约3200万段人类第一视角视频中筛出约149万段与目标动作相近的样本,再用于视觉—语言—动作模型后训练。
同样使用149万段人类视频,随机采样基线在三项实机任务上的总体成功率为47.7%,SiMDex达到61.1%,提高13.4个百分点。被选数据不足候选池的5%,结果指向一个直接问题:机器人训练缺的未必是更多视频,而是与当前任务真正匹配的视频。
论文图1:SiMDex依次用语义与手部姿态召回、动作轨迹排序和光流重排序筛选人类视频。
把数据选择改成推荐问题
人类手臂和机器人机械臂形态不同,直接按画面相似度找视频容易选中“看起来像、动作却不同”的片段。SiMDex先用语言描述和手部姿态做大规模召回,再比较手腕位置、旋转和手指轨迹,最后用光流检查动作是否真的接近。
整个过程工作在与具体机械结构无关的动作空间,不要求修改原有VLA架构和训练方法。每段机器人示范相当于推荐系统里的查询,人类视频池则是待排序的候选库;计算成本较高的检查只留给前两轮筛出的少量样本。
论文图2:实机评测包括钻孔、拨轮和四种物体取放,均被拆成多个连续子动作。
两项任务涨得多,钻孔却落后
团队在工业装配场景测试三项灵巧操作。拨轮任务成功率从24.5%升至45.5%,四种物体取放从54.0%升至83.4%;钻孔任务则从64.5%降到54.5%。三项合并后,SiMDex仍取得61.1%的总体成功率。
论文图3:机器人示范减少时,精选人类视频维持约57%至58%的总体成功率;钻孔任务在数据充足时出现反向结果。
钻孔暴露了检索边界。候选池里相似的高质量动作不够多,单看运动学还会把手部几乎不动的“钻孔”画面排到前面。光流重排序能纠正一部分错误,但会增加计算成本,也无法补出视频中没有的接触力和物体状态。
结论只覆盖一间工位
实验使用约12.4小时机器人示范,场景限定在工业装配,任务只有三项。每项标准结果来自两轮、每轮五次试验,小样本带来的波动不容忽视。
论文图4:从初始召回到动作排序、光流重排,候选视频与机器人示范逐步接近。
SiMDex证明了精选数据可以在现有训练管线中带来实机收益,但没有证明该策略能跨场景、跨机器人稳定复现。下一步要看的不是视频池还能扩到多大,而是检索能否纳入力、接触和物体状态,并在更多真实任务上保持收益。