论文导读
哈佛大学、麻省理工学院、约翰斯·霍普金斯大学等机构提出MoSE3,从单目视频同时估计每个像素的三维移动、旋转和共同运动分组。团队还构建了5000个合成场景补充运动标注。在iTACO上,完整分组版本的逐像素旋转误差为12.30度,让物体怎么动、哪些部分一起动成为可比较的输出。
知道点移到哪,还不够描述物体运动
像素从左边移到右边,可能是物体平移,也可能是物体绕自身旋转。跟踪每个点的位置可以画出路径,却没有直接说明物体朝向怎么变化,也不能自动判断哪些点属于同一个刚性部件。
MoSE3把目标扩展为移动、旋转和分组。打开柜门时,门与柜体需要分开;同一块门板上的点应当共享运动。输出是在共同世界坐标中表达的局部三维变换,而非只有画面坐标中的移动箭头。
方法使用普通RGB视频作为输入,无需推理时给它一套人工标注的物体零件。这个输入条件方便与现有视觉流水线衔接,输出则更接近物体交互任务所需的结构。
图:蝴蝶、车辆及可变形对象的运动坐标轴与彩色分组。
先找轨迹和同动关系,再求旋转
团队没有直接让网络一次猜出每个像素的全部旋转参数。模型先估计三维点轨迹,并学习哪些像素属于共同运动的区域,再利用这些关系拟合局部的旋转与平移。
这一流程把“点怎么走”和“哪些点应一起走”互相约束。若不同部件被错误归为一组,拟合结果会混合两种运动;训练时因此同时检查轨迹、分组和最终变换。
为了提供足够细的监督,Art-Kubric生成了5000个场景,每个有13至30个刚性或可动关节物体。场景包含接触、碰撞和移动相机,并导出深度、物体部件及逐帧运动标签,总计约1.63亿条轨迹。
图:视频输入经过几何与追踪分支得到三维运动表示的流程。
在真实交互和关节物体上分别检查
HO3D提供真实手物交互,iTACO提供带运动部件的合成视频。论文将已有三维追踪方法适配为比较基线,再检查每像素与物体部件层面的旋转、位置误差和分组质量。
iTACO逐像素旋转误差,采用学习分组的MoSE3为12.30度;用邻近点分组的自身版本为20.78度。HO3D中,这两个版本为18.28度和24.09度,说明如何组织共同运动的像素会影响恢复质量。
三维点追踪还覆盖PointOdyssey、ADT、PStudio三个数据集。论文报告了跨数据集平均优势,但并非每个数据集、每种指标都逐项领先。可变形场景目前只有定性演示,不能把它与刚性部件评测的量化结果合并。
下一步:给物体交互增加运动结构
普通视频转成带旋转和分组的运动表示,可继续用于物体部件理解、物理推理和机器人交互研究。项目可视化用坐标轴、轨迹和颜色显示不同输出,让这些预测能够逐项检查。
快速运动导致轨迹质量下降时,最终变换也会受影响;相机几何估计的误差同样会传递到世界坐标输出。后续扩展需要继续改进这些基础估计,并为可变形对象建立定量评测,检验演示以外的适用范围。
图:真实场景不同时间点的预测运动坐标轴和彩色运动分组。
参考资料
https://arxiv.org/abs/2610.03716