论文导读
银河通用、上海期智研究院、上海科技大学和上海交通大学提出PASSAGE,让人形机器人根据机载感知自主选择跨越、侧身或下蹲等穿越动作。系统用100小时场景对齐的人体运动训练,50次未见实机场景均到达目标,其中45次没有接触障碍;测试规模和环境仍有限。
杂乱环境不是只会绕路就够了
轮式机器人通常把障碍当作不可进入区域,人形机器人却可以利用身体形态:脚跨过矮物,身体侧过窄缝,头和躯干从横杆下钻过去。难点不只是复现某个动作,而是从第一视角感知中判断当下该用哪种行为,并让全身关节在不碰撞的情况下连续衔接。
图1:PASSAGE实机在办公环境中侧身、下蹲并跨越障碍。
PASSAGE不为每类障碍单独训练策略,也不要求人工给动作贴上“跨”“钻”等技能标签。团队用VR与惯性动作捕捉,在1500个杂乱场景收集100小时场景对齐的人体运动,让模型看到人的全身运动如何与具体几何结构对应。
一个规划器选动作,一个跟踪器把动作落地
系统由感知条件规划器和全身跟踪器组成。规划器读取运动历史、局部目标和机器人坐标系下的多层高程图,用条件流匹配生成短时参考动作;跟踪器以50 Hz执行,并用几何反馈修正身体。规划频率为6.25 Hz,通过分块与实时衔接减少相邻动作段跳变。
图2:数据采集把真人穿障动作与仿真场景几何对齐。
训练后期还冻结跟踪器,只对规划器做强化学习后训练。这样优化对象更接近闭环执行:规划器不能只生成“看起来像人”的姿态,还要考虑跟踪器实际能否稳定完成。系统最终在Jetson AGX Orin上运行三维激光雷达、在线占据地图、规划和控制,不依赖外部计算机或预建地图。
下一步:从50次测试走向开放空间
三次独立训练的仿真实验显示,把场景对齐动作数据从6小时扩到100小时,未见场景平均零接触成功率从48.1%升至68.9%;加入验证过的场景增强后,最终模型达到70.3%。实机测试覆盖50个未见布局,50次都走到目标,45次全程未碰障碍。
图3:论文报告的未见场景实机穿越结果与对照。
“全部到达”不等于在任意家庭或工厂都可靠:实机只有50次,速度、地面条件和障碍类型仍由论文设定。接触障碍的5次也说明规划与身体控制还有边界。PASSAGE的重要进展,是用统一的规划器—跟踪器组合自动选择多种全身行为,为人形机器人在狭窄真实空间移动提供了可扩展的数据路线。下一阶段还应加入移动障碍、湿滑地面、负载变化和感知遮挡,并公开碰撞严重程度与人工接管次数,而不只报告是否到达终点。
参考资料
https://arxiv.org/abs/2609.18732