arXivDaily arXiv每日学术速递 周一至周五更新

PAPERDAILY REPORTS

一段视频拆出数百个3D物体,阿里等团队提出WorldSculpt

作者:arXivDaily编辑部 arXiv 2609.05416 cs · cs.CV

论文导读

阿里达摩院Alaya实验室与东京大学团队提出WorldSculpt,从一段多视角视频恢复可组合的3D场景,并为其中每个物体输出独立网格。它面向含数百个物体、遮挡严重的场景,却主要用单物体数据微调。结果显示组合式重建可扩展,但真实场景质量仍依赖视角覆盖与分割准确度。

一个漂亮的3D整体,并不等于可编辑世界

新视角合成能把视频变成可浏览场景,但常把桌子、杯子、墙面和阴影烘焙进同一表示。用户可以移动相机,却很难单独拿起一个物体、替换材质或导入仿真。逐物体重建更实用,也更难:遮挡使同一物体只露出碎片,场景里的对象数量还可能从个位数增长到数百个。

WorldSculpt先从视频建立相机与场景线索,再为可见对象提取跨视角一致的实例信息。随后,模型把每个对象的多视角观测转换成独立3D网格,最终再按原始位置组装回完整世界。这个流程把“看起来像一个场景”和“由哪些物体构成”同时作为目标。

图:论文方法图展示从视频观测、实例关联到独立网格生成和场景重组的过程。

用单物体学习,靠组合在场景规模上扩展

直接收集成百上千物体且带高质量网格真值的大场景,代价很高。团队选择在单物体多视角数据上微调已有3D生成模型,让网络专注于“从若干观察补全一个物体”;场景层面则复用这一能力,对实例逐个处理。规模增加主要带来对象数量的线性工作,而不是要求网络一次吞下整个复杂世界。

为测试拥挤场景,论文还建立UE-MeshyScene:在虚幻引擎环境中组合大量带网格真值的资产,保留相机、实例和几何信息。它让研究者能分别测量每个对象的形状、位姿和整体场景合成,而非只看渲染图是否逼真。

图:论文数据样例展示多视角室内场景及其中大量可单独评估的对象。

场景越拥挤,逐物体路线的优势越明显

实验覆盖合成数据和HouseCat6D、Toys4K等真实或标准数据。论文按几何距离、表面重合和图像一致性比较WorldSculpt与整场景或单物体基线。结果显示,在对象数量较多、遮挡更强的设置中,逐实例建模更能保留物体边界和细节;场景重新组合后也可继续渲染新视角。

这些分数建立在已知或估计的相机、实例分割和有限视角上。如果一个物体在视频中几乎没出现,模型补全的是训练先验而非观测事实;透明、反光、细长结构与相互接触的对象仍容易出错。因此“数百个物体”描述的是处理规模,不代表每个物体都达到制作级精度。

图:论文对比图列出输入、不同方法和真值,便于观察遮挡物体的形状恢复差异。

下一步:把可组合表示接入编辑链路

输出独立网格后,游戏和AR/VR工具可以选择、移动或替换单个对象,机器人仿真也能给物体添加碰撞与交互属性。更进一步,场景编辑产生的新组合还能成为训练数据,形成“拍摄—拆解—编辑—仿真”的闭环。

要走到稳定生产,还需要更强的跨帧实例关联、材质与光照分解,并为不确定区域附上置信度。WorldSculpt最重要的变化,是把视频重建目标从一张可观看的3D照片,推进到一组可以继续操作的场景资产。

参考资料

https://arxiv.org/abs/2609.05416

https://alaya-lab.github.io/WorldSculpt/

https://github.com/AlayaLab/WorldSculpt