南洋理工大学、新加坡科技研究局、小鹏机器人和浙江大学等机构提出AnyWorld:不用成对拍摄人类与机器人示范,就能把一段第一视角人类交互重组为不同机器人本体、相机视角和场景下的机器人原生视频。生成数据随后用于RoboCasa GR1桌面基准和真实IRON人形机器人实验。
接触式操作数据昂贵,不只因为需要机器人反复抓取,还因为换一台机器人、移动相机或改变桌面布置,旧视频往往难以直接复用。AnyWorld试图保留“手和物体如何互动”这条动力学主线,同时允许身体、镜头和环境被独立替换。
一段视频拆成动作、镜头和身体
第一视角人类视频数量巨大,里面包含开盒、放置、倾倒等真实物理互动。但每段视频只记录一个人的身体、一条相机轨迹和一个环境。若直接拿它训练机器人,人的手臂形态与机器人夹爪不同,头戴相机运动也不等于机器人视角,模型可能把错误的视觉关系当成动作规律。
AnyWorld把交互分解为三类控制:动作控制描述运动结构,相机控制决定视角如何变化,本体上下文定义执行者的外形与接触几何。三个因素可以分别重组,因此同一底层互动能够换成不同机器人、不同观看方向和不同场景,而不必准备逐一配对的人机示范。
图:论文原始素材展示同一交互在场景和机器人本体变化后的重组结果。
先看大量人类互动,再混合机器人数据
训练分为两个阶段。模型先从大规模人类互动视频中学习物体接触和运动结构,再用混合本体数据微调,让生成结果逐步进入机器人域。这样利用了人类视频的规模,也让模型见到机器人关节、末端执行器和相机的真实差异。
生成时,研究者可以固定动作,只替换本体与视角;也可以固定本体,改变场景。这里的目标并非制作视觉上好看的机器人视频,而是得到可配对的视频—动作经验,使策略模型看到“这个机器人在这个画面里应该如何行动”。
图:论文展示用重组数据针对机器人策略缺口进行能力迁移的过程。
只改动作,学不会“放到指定位置”
AnyWorld在真实IRON人形机器人上设计了受控干预。一个问题是策略存在“虚假完成先验”:还没按要求完成目标,就倾向于判断任务已经结束。重组后的视频—动作对能够修正这种偏差,并帮助机器人依据语言选择空间目标。
论文还做了关键反事实:如果只校准动作而不重组视觉,机器人无法可靠学会语言指定的位置选择。原因在于“往左放”不只是轨迹变化,还涉及目标物在机器人视野中的位置。本体动作与视觉场景必须一起对齐,才能把人类经验转成机器人可用信号。
图:论文原始素材中的RoboCasa GR1生成操作序列。
让跨本体数据扩展接受真机检验
AnyWorld提供了一条比逐台采集更可扩展的路径:先从人类视频提取互动,再为目标机器人生成训练经验。它可能用于快速补足少见任务、改变相机安装后恢复策略,或在真实采集前构造有针对性的干预样本。
当前真机结论集中在论文设计的IRON任务,不能据此认定任意机器人和任意接触任务都能直接迁移。下一步需要在更多硬件、复杂遮挡与长操作链上检验生成数据是否保持几何一致,也要比较生成成本与真实遥操作采集的收益边界。
还需要建立生成数据的筛选门槛。视频看起来合理时,隐藏的接触点、力度或时间顺序仍可能错误;如果这些样本直接进入策略训练,视觉真实性反而会掩盖动作标签偏差。把仿真回放、真机小样本测试和失败轨迹复核接入数据管线,才能判断哪些重组经验值得保留。
参考资料
https://arxiv.org/abs/2608.29242