arXivDaily arXiv每日学术速递 周一至周五更新

PAPERDAILY REPORTS

宇树G1走进真实导航测试:HumanoidVLN覆盖4种人形机器人,仿真与现实高度相关

arXiv 2608.12860 cs.RO

“穿过走廊,在画旁边左转,再停到书架前。”这类指令对轮式机器人已不轻松,换成人形机器人还要同时处理步态、碰撞和身体尺寸。VinMotion与南加州大学提出HumanoidVLN,在4种人形平台、933条路线中评测语言导航,并把宇树G1带到真实场景验证仿真指标是否可信。

现有视觉语言导航研究多用抽象圆柱体或轮式底盘,默认机器人可以稳定移动到任意航点。人形机器人每一步都受全身动力学约束,转弯、狭窄通道和地面接触都会改变最终轨迹。HumanoidVLN把高层“听懂路线”和低层“真的走过去”接在一起。

从第一视角视频生成路线,再让多Agent互相校对

团队以第一视角室内导航视频、二维占用地图、场景图和轨迹元数据为输入。两个生成Agent先分别理解路线、地标和动作顺序,再聚合成草稿指令;验证Agent检查空间一致性、时间顺序、动作可执行性和信息完整度。未通过的样本会回到生成环节修改,最后由人工界面复核。

HumanoidVLN从视频和地图构建语言指令的多Agent标注流程

HumanoidVLN从视频和地图构建语言指令的多Agent标注流程。

这种设计不是简单给轨迹配一句模板。指令需要说明可见地标,又不能泄露机器人拿不到的全局坐标;还要适应“向右转”“绕过沙发”等具身动作。系统用改写Agent产生正式、自然和口语等不同表达,在保持动作与地标顺序的同时增加语言多样性。

933条路线覆盖4种身体,尺寸变化也会改变难度

基准包含宇树G1、H1以及两种内部人形机器人,共933个导航episode。不同机器人拥有不同身高、肩宽、关节和运动控制器,同一条路线对小型机体可能宽裕,对更大机体则会出现擦碰或无法通过。团队因此保留每种身体的真实动力学,而不是只在高层地图上判断到达。

不同场景重建方式对人形机器人导航轨迹的影响

不同场景重建方式对人形机器人导航轨迹的影响。

导航模型先根据图像和指令提出目标,再由运动策略执行。评测同时看成功率、终点距离与nDTW等轨迹质量指标,避免“最后碰巧到达”掩盖途中绕远或走错地标。最佳方法的平均成功率为43.55%,nDTW为48.38,说明大模型能理解相当一部分路线,但真正可靠的人形VLN仍有明显提升空间。

仿真误差与G1实机高度相关,相关系数达0.935

基准最重要的一步是把20条路线放到宇树G1实机上复现。研究者比较仿真与真实机器人的终点误差,得到0.935的相关系数,平均绝对差为0.68米;轨迹相似度达到0.782。这意味着仿真中更难的路线,在现实里通常也更难,排行榜至少能反映实机趋势。

双生成Agent为同一路线讨论并修正导航指令

双生成Agent为同一路线讨论并修正导航指令。

实机样本量仍是20条,不能覆盖全部房型、地面材质和人群干扰;43.55%的最佳成功率也不适合直接用于无人值守场景。但团队把“语言理解是否正确”和“身体是否走得稳”放到同一套复现实验里,为后续定位错误来源提供了统一起点。

宇树G1在真实环境中执行语言导航的实验画面

宇树G1在真实环境中执行语言导航的实验画面。

下一步走向可迁移的家庭与服务机器人导航

HumanoidVLN的价值不只是新增一个排行榜,而是让算法在换身体时也必须接受检验。未来可以把同一条指令分发给不同尺寸与步态的机器人,观察高层策略是否学到可迁移的空间概念,再为每种平台调整低层控制。仿真—现实指标已有较高相关性,也适合先在大规模虚拟环境筛选模型,再把少量候选带到实机精测。

面向家庭和公共服务,还可以加入移动的人、临时障碍、开关门与电梯等连续交互,并让机器人主动追问模糊指令。若数据扩展到更多建筑和更长任务,HumanoidVLN有望成为连接视觉语言模型、全身控制器和安全验证的公共接口,让“听懂去哪儿”真正落到“稳稳走到那里”。

评测工具也可以进一步拆分导航失败:模型是否误解了地标、航点是否落在不可达区域、低层控制是否摔倒。按身体和场景公开这三类记录,研究者就能有针对性地改语言模型、地图表示或步态控制,而不是只追逐一个总成功率。

参考资料

https://arxiv.org/abs/2608.12860