arXivDaily arXiv每日学术速递 周一至周五更新

PAPERDAILY REPORTS

首尔大学先把机器人画进视频再预测未来,世界模型能适配未见过的机械臂

作者:arXivDaily编辑部 arXiv 2607.22535 cs · cs.CV · cs.RO

机器人世界模型通常直接接收关节或末端动作向量,再预测未来画面。换一台机械臂,向量含义和运动学关系都可能变化。首尔大学、RLWRLD团队提出RoFacto:先让控制器把命令变成名义轨迹,再把机器人几何渲染进相机画面,视频模型只学习物体如何响应。

论文报告,渲染接口优于动作向量条件基线,并能在推理时组合训练中未见的机器人形态。团队还把人类手部示范重定向为机器人几何,生成机器人操作视频;这些视频是模型预测,不等于真实策略已经执行成功。

把机器人自身从世界模型里拆出来

动作影响画面分两步:机器人控制器先把命令实现为机械运动,机械臂再通过接触改变物体。直接输入命令,要求世界模型同时学习控制器、运动学和物体动力学;输入真实未来状态又会泄露模型本应预测的结果。

论文Figure 1:静态场景提供环境与视角,渲染的名义机器人轨迹提供动作,模型预测场景响应。

RoFacto使用机器人已有的控制器和运动学生成“部署时可得到”的名义轨迹,再依据URDF、相机参数和机器人外观渲染RGB与深度。模型看到的动作不再是一串设备专用数字,而是目标相机里的可见机器人几何。

深度提示接触,不只看二维重叠

机械爪在二维画面中靠近物体,不一定真的发生接触。系统同时输入末端深度和场景深度,用几何距离区分遮挡、靠近与接触相关位置。

论文Figure 3:渲染机器人几何更准确定位动作区域,深度补充接触与遮挡信息。

对照实验表明,名义轨迹比原始动作命令更容易驱动正确的场景变化;去掉深度后,模型在图像平面重叠但空间距离不同的情况中更容易出错。

人类示范先转成机器人几何

人手和机械臂的关节结构不同,RoFacto先把人类动作重定向到机器人,再用同一渲染接口生成几何条件。视频模型据此预测机器人与物体交互的后续画面。

论文Figure 7:人手动作经过重定向和机器人渲染,生成对应的机器人交互rollout。

同一接口还被用于训练中未出现的双臂Franka Panda组合。模型不需要接收新的关节向量定义,而是继续读取渲染后的RGB与深度序列。

“未见过的机器人”在这里指训练阶段未以同一形态组合出现,模型仍获得该机器人的URDF、相机参数和渲染结果,并非在完全没有结构信息时自行识别陌生硬件。方法泛化的是统一视觉接口,机器人几何和控制器仍要由系统提供。

名义轨迹同样不是实际未来状态。控制器根据命令给出计划运动,渲染器把这条计划画进画面;真实执行中的碰撞、柔性形变和跟踪误差仍由世界模型预测。如果控制器本身偏差很大,作为条件的几何轨迹也会把误差带进后续视频。

渲染接口还要求相机标定足够准确。机械臂轮廓若与真实画面错位,模型会把几何误差和物体运动混在一起学习。跨实验室复用时,除了替换URDF,还要重新核对内外参、深度尺度和机器人外观。

论文Figure 9:未见双臂Franka Panda系统被渲染为几何条件,送入同一视频模型。

下一步要从视频预测走向策略闭环

可视几何接口为跨机器人世界模型提供了统一输入,适合比较不同机械臂、相机视角和人类示范。机器人硬件知识保留在控制器、URDF和渲染器中,视频模型集中学习接触后的场景变化。

当前结果主要验证预测质量和跨形态组合。若要用于真实规划,还要让策略根据预测选择动作,并在执行后用新观察闭环修正。URDF误差、软体物体、摩擦和控制器偏差也会影响渲染轨迹与真实运动的一致性。

参考资料

https://arxiv.org/abs/2607.22535

https://arxiv.org/html/2607.22535

https://bjkim95.github.io/rofacto/