论文导读
南加州大学、斯坦福大学、麻省理工学院、加州大学圣迭戈分校等机构推出Neverwhere,把超过60个真实室内外场景重建成可闭环运行的机器人考场。视觉运动控制器能在部署前反复接受台阶、沟槽和障碍测试,失败条件也能复现。论文还发现,只靠3D高斯场景训练会留下泛化缺口,多样数据仍是稳定表现的关键。
真实路测昂贵,普通仿真又太干净
四足机器人在实验室跨过几个固定障碍,不代表它能处理办公室地毯、室外砖地、强光和复杂背景。直接在真实环境反复测试成本高,还难保证每个版本面对完全相同的条件;传统仿真方便复现,画面却常与真实相机差别很大。
Neverwhere用3D Gaussian Splatting重建现实场景。它把大量带位置的彩色高斯点组织成可实时渲染的环境,让机器人相机看到更接近真实拍摄的纹理,同时保留物理碰撞几何供闭环控制使用。
项目页原图:基准覆盖室内外多类真实重建场景与不同材质、障碍布局。
看得像真实世界,还得碰得到障碍
视觉重建只解决“看到什么”,机器人测试还要知道台阶、箱体和地面在哪里。项目先采集场景,再生成高斯表示;随后从视觉重建中提取或人工校准碰撞几何,把可渲染画面和可接触表面对齐。
项目页流程图:真实场景经重建、几何标注与碰撞结构处理后进入机器人闭环仿真。
控制器每一步都根据渲染相机画面产生动作,动作改变机器人状态,新视角再送回模型。与播放固定视频不同,这种闭环会把一次判断错误继续带到后续运动中,更接近真实部署里的连续风险。
60多个场景不是一张“大训练图”
Neverwhere包含超过60个城市室内外重建,任务包括跨越沟槽、绕障和处理不同高度结构。团队提供场景接入工具、策略检查点和连续评测设置,目标是让不同控制器面对相同环境与任务。
论文也专门检查只使用这些高斯场景训练的风险。策略在熟悉场景表现很好,换到新场景后会下降;增加训练场景能改善泛化,但不同任务受益程度不一。逼真的画面并不会自动带来足够的材质、光照、几何和相机变化。
项目页原图:同一重建环境中的机器人视角、渲染RGB、深度与碰撞几何,用于核对视觉和物理结构。
这些结果仍属于仿真评测。传感器延迟、执行器磨损、地面摩擦变化和动态行人没有被一套静态重建完全覆盖,因此它是部署前筛查工具,不是实地测试的替代品。
下一步,让机器人也拥有持续回归测试
软件每次改版都会跑自动测试,机器人策略同样需要固定考场。Neverwhere适合在训练后批量运行,找出新版本在哪类地面或障碍上退化,再把失败场景加入训练。下一步如果能记录标准化碰撞、恢复动作和跨场景统计,视觉运动控制器的升级就能从“看几段成功视频”转向可重复的版本比较。