论文导读
加州大学伯克利分校、上海科技大学、Google DeepMind等机构提出HuGo,让大语言模型为人形机器人编写能反复根据观察调整动作的任务代码。机器人底层走路与平衡能力保持不变,上层代码负责决定何时走、伸手和搬物。在论文的低门穿行模拟任务中,方案达到100%成功率;团队还把部分仿真生成的策略带到实体机器人上演示,展示了减少逐项设计奖励与收集示范的可能。
从会走路到会做事,中间缺了什么
人形机器人走过崎岖地面已经不容易,但普通人希望它做的是按电梯按钮、穿过狭窄入口、把箱子搬到合适位置。这些任务既要保持平衡,又要判断物体何时可触、手该放哪里。过去常为每项任务单独设计奖励函数训练,或者让人反复示范。任务越多,准备成本越高。
HuGo把两层能力分开。底层是已有的全身运动控制器,负责把抽象命令变成稳定的关节动作;上层由大模型根据任务描述写代码,决定机器人下一步朝哪里移动、两只手放到哪里、身体高度怎样调整。代码不是一次性剧本,而会在运行中读取机器人状态并继续决策。对工程师来说,这比让语言模型直接输出每个关节角度更可控:它只负责规划可解释的高层动作。
大模型先写,再看回放改代码
研究团队让大模型先生成一版策略,在仿真中运行,再把轨迹数值和部分视频帧反馈给它。若机器人转身不够、抓箱位置不对,模型可针对局部代码提出修改,而不是每次重头生成。这个循环不需要为每项新任务人工准备强化学习奖励或完整示范,却仍依赖既有底层策略和任务描述。它并不是“只给一句话,机器人立刻无条件学会任何动作”。
图中实体机器人按照连续帧走向按钮、调整站位并伸手。照片显示的是论文报告的一段实机执行过程,不能据此推断所有场景都同样成功。它的意义在于,仿真里形成的高层代码至少能够接入真实硬件的低层控制器。
图:实体人形机器人移动、调整朝向后伸手触碰目标按钮的连续画面。
成功率要看是哪项任务
论文评估了五种仿真任务,并使用两种不同底层策略。HuGo相对高层强化学习基线表现更好,在部分任务接近依赖示范的方案。标题中的100%来自低门穿行这一项的实验结果,不是整套任务平均值,也不是现实家庭里随叫随到的可靠性保证。窄门穿行、推箱、举箱等任务同样被测试,但每一项难点不同,应分别看原论文的表格和条件。
实体举箱照片展示机器人靠近、抓住并抬起箱子的过程。这里最难的是行走与双手操作连续衔接:站位不对,再好的手臂轨迹也拿不到箱子。研究者把仿真中写出的代码迁移到实机,还尝试用实机回放继续改进执行。这样的迁移说明方法有实践潜力,但并不等于无需任何硬件适配。
图:实体人形机器人在接近箱子后执行双手抬举动作的连续帧。
窄门通过场景里,机器人要在门板之间选择路径、协调身体姿态和脚步。图中网格地面与简化门板说明这是仿真测试,而非真实门廊录像。它与实体按钮、举箱图片承担不同作用:前者检验策略在可控环境中组合动作,后者展示迁移到真实机器人后的样貌。
图:网格仿真环境里,人形机器人从两块门板之间通过的测试画面。
下一步是让任务代码经得住现实变化
HuGo提示一种扩展人形机器人技能库的路径:保留可靠的底层控制,让大模型更快地编写和修订任务级策略。若要走向仓储、家庭或服务现场,还需处理意外障碍、物体尺寸变化、传感器误差及安全停机等问题。真正有价值的不是某个仿真分数本身,而是把“新任务需要重新训练”变成“先写可审查的策略,再在回放中改进”,让技能迭代更容易追踪。
参考资料
https://arxiv.org/abs/2609.30594