arXivDaily arXiv每日学术速递 周一至周五更新

PAPERDAILY REPORTS

字节Seed把真实房间变成可编辑仿真场景,F-Score升至0.924

作者:arXivDaily编辑部 arXiv 2608.30821 cs · cs.AI · cs.CV

字节跳动Seed、北京大学和浙江大学联合提出Lucida,把一段真实室内视频转成仿真可用的场景副本:房间里的物体不仅被重建,还能作为独立3D资产移动和编辑。论文报告其场景F-Score由SAM3D的0.794提高到0.924。

传统三维重建可以还原“看起来像这个房间”的表面,却未必知道桌子、椅子和柜子各自是什么,更难在仿真里单独拿起或换位置。Lucida沿用解析、生成、放置三步结构,但把精度要求推迟到最后闭环对齐,适应杂乱、遮挡严重的真实拍摄。

不要求第一步就看清完整物体

现有真实到仿真流程常有一组互相冲突的前提:实例分割希望得到准确几何,资产生成希望看到无遮挡物体,放置阶段又希望资产与观测完全匹配。但真实房间中的椅腿会被桌子挡住,柜体可能只拍到一面,一开始就要求完整输入并不现实。

Lucida先把视频解析成场景图。每个节点对应一个物体实例,同时保存来自不同视角的证据,而不是急于确认完整几何。随后,生成模块依据这些不完整但互补的观测补全独立资产。流程接受前端信息的不确定性,把最终位置与姿态精度交给后续环节逐步修正。

图:项目页展示Lucida的实例证据构建、资产生成和放置流程。

GizmoAct像操作建模软件一样摆物体

最特别的一步是GizmoAct。它把物体放置改写成多轮图形界面交互:视觉语言模型观察当前渲染与真实画面的差异,操作三维软件中的平移、旋转和缩放控件,然后再次检查对齐情况,直到自行判断位置已经足够准确。

这种闭环把一次性姿态回归变成连续修正。即使生成资产与真实物体形状不完全一致,策略仍能利用多视角证据寻找更合理的位置。对机器人仿真而言,物体之间的相对关系尤其重要,因为抓取和导航都依赖桌面高度、通道宽度与可达空间。

图:项目页中的GizmoAct界面与多轮交互轨迹,展示物体姿态如何逐步对齐。

三组指标分别检查识别、姿态和场景

Lucida没有只用一项视觉相似度评价整套系统。场景级3D物体检测中,它在R2S-Scene上相对Boxer把mAP提高69%;物体姿态估计中,CA-1M上的ADD-SB@0.05由57.8%升至83.4%;整体场景重建中,F-Score由SAM3D的0.794升至0.924。

三组结果分别回答“物体找到了吗”“摆放姿态对吗”“整体表面还原好吗”。项目图也展示了真实输入、生成资产和重组场景的对应关系。实验来自R2S-Scene、CA-1M等受控数据集,复杂开放空间、透明物体和大面积遮挡仍需要单独验证。

图:论文原始场景级实验图,对比输入观测、资产放置与重建结果。

真实房间走向机器人训练起点

可组合的真实到仿真场景能减少人工搭建数字环境的工作:研究者可以拍摄一间办公室,再在副本中移动障碍、替换物体或生成不同任务布局。独立资产也让碰撞、抓取点和状态变化更容易进入模拟器。

下一步的检验重点会从“重建得像”扩展到“机器人用起来是否可靠”。如果在Lucida场景里训练的策略能迁移回真实房间,并在物体更换或位置调整后保持成功率,这条解析—生成—放置路线才会真正成为可规模化的仿真数据入口。

场景资产还需要附带仿真所需的物理属性。视觉重建能提供形状与姿态,却不自动给出质量、摩擦、关节类型和可交互部件;机器人若要推门、拉抽屉或搬动容器,这些参数会直接改变动作结果。后续工作可把视频中的运动线索、人工少量校准与物理引擎反演结合,让独立资产不仅可移动,也具备可验证的交互行为。

另一项实用检查是更新成本。真实房间换了桌椅后,系统是否只需重建局部节点,还是必须重新处理整段视频,将影响部署效率。Lucida的场景图结构为局部更新提供了接口,但仍需用跨时间采集证明这种组合性。

参考资料

https://arxiv.org/abs/2608.30821

https://lucida-r2s.github.io/