一把电钻不是不可编辑的整体,而应该由机身、电池、钻头等零件组成;这些零件单独看要完整,装回去又不能留下裂缝。华为与上海交通大学团队开源SCULPT,像雕塑家从材料上逐次切割一样,从完整3D形状中迭代取出部件,并根据物体复杂度自动决定零件数量。
传统单图到3D方法已经能生成外观漂亮的模型,却通常只有一个整体网格。后续若要动画、换零件、物理仿真或制造,还得由人工重新拆分。另一类方法先分别生成零件再拼装,容易出现彼此穿插、接缝悬空或整体轮廓改变。
用“减法”做部件生成,每一步都从剩余形状里切
SCULPT把任务写成连续决策。系统从完整物体开始,联合分割预测器每一步输出一个新部件以及切除后剩下的形状;下一步继续在余料中寻找结构,直到模型判断无需再分。由于新部件始终来自当前整体,它与剩余部分天然共享边界,装回去时更容易保持严丝合缝。
SCULPT逐次切出3D部件并保持整体可重组。
这与一次性语义分割不同。一次性方法往往预设类别或固定部件数,而现实物体可能只有两个大部件,也可能包含许多小结构。SCULPT的停止机制让部件数量随输入自适应;切割顺序还提供了一条层级轨迹,可以观察模型如何从主体逐渐细化到附属零件。
同时约束部件完整性与装配后的外形
如果只追求每个切片像一个独立物体,系统可能牺牲整体轮廓;只追求重建误差,又可能切出没有意义的薄片。SCULPT在迭代过程中同时建模新部件、剩余形状和二者组合,让局部几何可用性与全局一致性共同进入学习目标。
SCULPT在不同迭代步中逐渐分解物体的过程。
团队基于PartObjaverse构建训练与评测,并展示了家具、工具、乐器、动物造型等多类对象。定性结果中,模型能够区分主体与具有结构意义的附件,零件拆开后轮廓保持完整,重新组合又恢复原始物体。它还可以接收真实图片或其他生成模型产出的3D形状,成为现有资产流水线的后处理模块。
单图生成的3D资产,也能补上一套部件结构
论文将SCULPT接到TRELLIS等图生3D系统之后:先从一张照片得到整体几何,再执行减法式拆分。这样,内容创作者无需等待新的端到端部件生成大模型,就能把已有单体资产转成可编辑表示。颜色展示也让每个部件的边界和装配关系更直观。
SCULPT在多类3D物体上的部件生成与重组效果。
SCULPT与图生3D流水线结合处理真实输入。
当前实验主要围绕PartObjaverse和论文展示的真实、生成输入,自动拆分也不等同工程级装配设计:轴承、公差、卡扣和材料强度仍需要专业约束。不过它已经把“看起来像一个物体”推进到“内部拥有可操作部件”,为结构编辑提供了更合适的表示。
下一步走向可动画、可制造的3D资产流水线
游戏和影视制作可以直接替换零件、设置关节或制作破坏动画;机器人仿真可以把把手、按钮和可抓取部件作为交互对象;电商展示也能让用户拆看产品结构。若结合文字编辑,创作者还可以说“保留琴身,换一种琴颈”,只重生成指定部件。
更长远的方向是把几何拆分与功能理解连接起来:不仅知道哪里能切,还知道哪个部件旋转、滑动或承担支撑。再加入碰撞、公差与连接件规则,SCULPT的减法轨迹就可能成为从视觉资产到机械装配的中间层。开源代码让研究者可以在不同3D基础模型上验证这一思路,逐步补齐材质、拓扑和物理属性。
减法过程本身还提供了可解释的编辑历史。用户可以回退到任意一步,合并过细的部件,或指定下一刀必须经过某个区域。若把这种交互反馈纳入训练,系统就能逐渐学习不同产业对“合理部件”的定义:动画师关心关节,制造工程师关心装配,机器人研究者则关心抓取与可动性。
参考资料
https://arxiv.org/abs/2608.13541