机器人只模仿动作,可能学会在训练画面里伸手,却没有形成稳定的三维结构与物体运动表示。图灵智新、中科院自动化所、清华大学等机构提出GaussianDream++,训练时要求视觉语言动作模型重建当前3D世界并预测未来,部署时再移除重建头。
模型在LIBERO达到98.6%,LIBERO-Plus达到87.8%。真实机器人实验中,平均成功率从复现π0.5的29.2%提高到52.5%。在线推理只保留20个世界Token,不执行3D高斯解码或未来滚动。
当前世界与未来变化分给两组Token
此前GaussianDream用稠密视觉几何前缀同时承载状态、未来和动作条件,信息混在一起,部署成本也高。新版直接在VLA主干插入World State Tokens和World Prediction Tokens,前者描述当前场景,后者承担短期物理变化。
项目页总览:世界Token进入VLA主干,训练期表示头解码当前与未来3D高斯。
训练期的世界表示头把两组Token解码成共享高斯基元。静态—动态分解保留桌面、墙面等持久结构,把残差运动集中在机械臂、被抓物体和接触区域。动作损失之外,模型因此获得明确的几何和未来监督。
部署时拿掉渲染器,只保留紧凑表示
3D世界模型常在推理时重建点云或图像,再让策略读取,延迟会进入控制回路。GaussianDream++把解码头视为训练教师:部署时移除世界表示头、渲染器、辅助目标和VGGT/TGE路径,20个Token继续随主干参与动作预测。
项目页结构图:当前状态和未来预测分离训练,部署端只留下策略内部的紧凑Token。
这种设计不能在部署时直接输出可查看的3D世界,但减少了在线计算。论文把速度优势建立在“训练时解码、推理时隐式使用”上;Token是否在更长任务中仍保留准确几何,需要额外探针验证。
相机与布局变化下的提升最明显
LIBERO的98.6%接近饱和,更能区分方法的是LIBERO-Plus。GaussianDream++达到87.8%,作者报告相机和布局扰动下的增益较清楚。三维监督恰好约束了视角变化与物体相对位置。
项目页定性图:模型对当前场景与未来交互区域的三维表示。
高分仍来自标准化仿真任务。训练世界头使用可获得的几何监督,真实部署不一定拥有同样相机质量;模型也只预测短期未来,不能据此认为它已具备长期物理规划。
下一步:扩大实机任务与本体范围
真实机器人任务中,平均成功率由29.2%升至52.5%。项目图展示碗与盘等桌面操作和相机设置,比较使用相同复现基线。
项目页实机评测:GaussianDream++与复现π0.5在多项桌面任务上的平均成功率。
下一步需要增加透明、反光和遮挡物体,测试世界Token在视觉几何最容易失真的场景。若20个Token能在换相机、换机械臂和更长操作中保持收益,这套“训练时具象、部署时压缩”的路线才可能成为VLA模型的通用辅助目标。
还应比较Token数量与控制性能的曲线。20个是论文选定的紧凑配置,但不同任务可能需要不同空间容量;若减少到10个性能几乎不变,仍有压缩空间,若增加到40个只改善仿真而拖慢实机,部署价值就有限。报告在线延迟、控制频率和显存,才能确认移除渲染头后的实际收益。
训练期几何监督也可能来自不同来源,包括多视角相机、深度传感器或离线重建。下一步需要说明哪类监督是必要条件,以及低成本单目数据能否达到相近效果。否则方法虽然推理便宜,数据准备仍可能成为换场景时的主要成本。
真实机器人还要测试连续多次操作后的状态漂移。一次抓取成功不代表世界Token能在长序列中保持物体位置;若每完成一步都需要重新观察,系统应报告重置频率和由此产生的延迟。遇到遮挡后重新出现的物体,也要确认表示能否恢复同一身份,而不是把它当成新对象。
参考资料
https://arxiv.org/abs/2608.25659
https://arxiv.org/html/2608.25659
https://tuojingai.github.io/GaussianDream-Series-project-page/