arXivDaily arXiv每日学术速递 周一至周五更新

PAPERDAILY REPORTS

中科大等让人形机器人走完1.5公里:SOLO零样本穿越户外复杂地形

作者:arXivDaily编辑部 arXiv 2608.26583 cs · cs.RO

人形机器人走几级台阶并不罕见,难的是在长距离中持续处理台阶、斜坡、窄落脚点和感知噪声。中国科学技术大学、X-Humanoid、清华大学等机构提出SOLO,仅用胸前深度相机和本体感知零样本部署,完成1.5公里连续户外路线。

仿真压力测试中,SOLO平均通行成功率达到97.5%,踏脚石任务达到96%;使用密集地形重构的对照分别只有75.0至75.6%和0至3%。这两组百分比来自仿真,1.5公里则来自实机路线,条件需要分开理解。

长距离失败来自感知与控制共同累积

常见策略先把深度图压成稠密高度图,再交给控制器。下采样和卷积会把台阶边缘、窄梁和稀疏落脚点磨平,短路线里偶尔的高度误差,在几百步之后可能变成踩空或失衡。

另一处问题是逐时刻模仿。学生策略只对当前动作贴近教师负责,没有收到“这一步会让几步后的状态偏离”的信号,因此很难为未来稳定性调整当前落脚。

图1:查询重构保留台阶边缘和稀疏落脚点,密集重构更容易平滑关键结构。

用查询重构器只取动作需要的地形证据

SOLO的Query Reconstructor不要求先生成完整高度图,而是为每个空间单元构造带傅里叶位置编码的查询,从深度与本体感知Token中检索相关证据。控制器因此能保留脚边的尖锐边界,而不必把远处和近处都用相同密度重建。

仿真中,这一设计把高度图L1误差降低3.3至4.0倍。数字反映指定地形上的重构误差,不等于机器人整体成功率按同样倍数提高。

图2:学生策略从深度和本体感知中重构动作关键地形,并接受轨迹感知蒸馏。

把下一状态分歧写进强化学习奖励

Trajectory-Aware MSE蒸馏比较教师与学生在下一状态的动作分歧,再把惩罚加入PPO奖励。广义优势估计会把未来分歧向前传播,使策略在更早的动作上为后续稳定性负责。

课程训练中,这一方法比单独PPO和逐点MSE加PPO推进得更远。压力地形上,SOLO平均成功率97.5%,踏脚石成功率96%;密集重构变体在踏脚石上只有0至3%,显示稀疏几何保真对精确落脚尤其关键。

图3:SOLO与多种重构、训练变体在高难度台阶和落脚石上的成功率对比。

1.5公里实机路线验证长时稳定性

实机只使用胸前深度相机和关节本体感知,没有针对户外路线继续训练。机器人连续经过台阶、坡面和不规则路段,另在室内完成混合地形路线。长路线展示验证了策略能持续运行,但论文没有把一次演示写成所有环境下的通用成功率。

图4:实机在室内连续通过台阶、斜坡和不规则落脚区域。

从长距离演示走向日常部署

SOLO适合巡检、园区运输和需要跨越台阶的服务机器人。下一步应在不同机体、光照、雨水和深度相机失真条件下重复长路线,并报告摔倒、急停和人工接管次数。

现实部署还要加入行人避让、路径规划和故障安全。当前97.5%来自仿真压力测试,1.5公里来自特定机器人和路线;只有多地点、多日重复结果稳定,长程运动能力才算进入可运营阶段。

能耗也是长距离任务的硬指标。更细的地形查询和频繁控制更新会占用计算资源,电池余量又会改变执行器状态。后续实机测试应同步报告单位距离能耗、控制频率、温度和电量下降后的成功率。

另一项验证是传感器退化。胸前深度相机在强光、反光地面和雨雾中可能产生空洞或错误深度,策略需要识别不可信输入并主动降速。将这些场景加入连续路线,比单独测试一个高台更接近日常巡检条件。

长路线的完整原始日志也应随结果保存。

参考资料

https://sunpihai-up.github.io/solo/

https://arxiv.org/abs/2608.26583