arXivDaily arXiv每日学术速递 周一至周五更新

PAPERDAILY REPORTS

阿里通义把人类视频变成18561小时机器人训练数据

arXiv 2608.02580 cs.RO

阿里巴巴通义千问、中国人民大学、上海科技大学、北京通用人工智能研究院和北京航空航天大学团队发布Ego2Robot,把人类佩戴相机拍下的第一视角操作视频转换为机器人训练数据。整套数据达到18561小时,覆盖15种机器人形态。

数据不要求人类先用遥操作设备控制机器人。流水线从普通人手部动作中恢复轨迹,再把动作映射到机械臂,并在画面中合成机器人外观,最后经过多级质量筛选。

Ego2Robot从人类视频生成机器人训练数据的流程

论文图1:动作对齐、机器人视觉合成和质量筛选共同把第一视角视频转换为训练数据。

一段人类视频要过三道转换

人手和机械臂的关节结构不同,直接复制动作会出现姿态不可达、抓取位置偏移等问题。Ego2Robot先估计相机、手部与物体运动,再按照目标机器人结构重新计算动作轨迹。

第二步处理视觉差异。系统保留真实场景和被操作物体,在人臂区域合成机械臂,让视频的观察视角、动作标签和机器人形态对应起来。质量筛选会检查动作可执行性、画面一致性和任务内容,减少明显错误样本进入预训练。

15种受支持的机器人形态

论文图6:数据覆盖15种不同机械臂和机器人形态,而非绑定一套硬件。

18561小时并不全来自规整实验室。流水线同时处理经过整理的数据集与开放环境视频,规模高于论文使用的约6565小时原始机器人数据。大规模合成的用途是预训练视觉—语言—动作模型,真实机器人数据仍参与联合训练。

测试把四种泛化问题拆开

团队扩展RoboTwin2.0,把常被混在一起的变化拆成视觉外观、场景布局、机器人形态和任务语义四条轴,共设置12种评测条件。模型需要面对换背景、换位置、换机械臂或换任务描述,而不能只记住训练场景。

联合使用Ego2Robot与真实机器人数据后,多种分布外条件的成功率均高于只用真实机器人数据的版本。随着合成数据覆盖的机器人形态增加,随机化场景中的表现继续提高。论文据此把收益归因于更广的数据覆盖,而非某一个任务的重复采样。

Ego2Robot在真实机器人上的五项任务

论文图5:ARX ACone平台完成五项真实操作任务的关键帧。

真机验证有收益,但合成数据没有取代实拍

团队还在ARX ACone平台测试五项任务,包括取放和物体操作。加入Ego2Robot预训练的策略在真机上的平均成功率更高,说明由人类视频转换的数据可以跨过仿真与真实部署之间的一部分差距。

加入Ego2Robot数据前后的真机成功率

论文图4:五项真机任务对比联合预训练与不同数据配置的成功率。

论文没有证明18561小时合成数据等价于同规模真机数据。动作估计、视觉合成和重定向都会引入误差,复杂接触、力反馈和失败恢复也难从普通视频完整获得。现阶段更准确的定位,是用海量人类视频扩充预训练覆盖,再用真实机器人数据校正执行细节。

参考资料

https://arxiv.org/abs/2608.02580