加州理工学院研究团队把一套名为PAC-MAN的控制方法部署到宇树Unitree G1上。研究人员从正面向机器人手掷20次球,G1躲过19次,没有摔倒,实机成功率为95%。
这不是预先编排的一段闪避动作。机器人需要用头部相机捕捉来球,判断身体哪个部位可能被击中,再协调躯干、手臂和双腿完成闪避。整个控制过程以50Hz运行,从仿真训练得到的策略直接迁移到实机。
论文图1:Unitree G1利用头部相机的深度与分割结果感知来球,并执行全身闪避。
球只要碰到任何身体部位,就算失败
论文采用了严格的“全身接触”判定。球碰到头、手臂、躯干或腿部中的任何一处,都会被记为命中。机器人还需要保持平衡,并在每次投掷后走回固定位置,准备下一轮测试。
硬件使用安装在头部的ZED Mini相机。EfficientTAM跟踪器以约60Hz从RGB画面中分割球体,再保留对应区域的深度信息。策略最终看到的是压缩后的16×9深度表示,不会拿到球的真实三维坐标、速度估计或外部定位数据。
系统还会过滤飞点、尺寸异常目标和没有快速接近的静态物体。跟踪丢失时,策略收到的是“远处无球”画面,避免错误目标触发突然闪避。研究人员用同一套分割流程测试了泡沫球和足球,跟踪器只需重新指定目标。
论文图2:策略接收连续深度图和本体状态,训练阶段再加入球体与各身体连杆之间的安全约束。
安全约束太复杂,感知跟不上反而会掉分
PAC-MAN把强化学习与控制屏障函数结合。控制屏障函数用于描述安全区域,例如球和机器人各身体部位之间必须保留多大距离。训练时,安全约束引导策略学习避让动作;对抗式动作先验负责让动作保持接近人类运动,减少不稳定姿态。
团队比较了两种安全设计。Link-CBF分别约束各身体连杆,结构较轻;Joint-CBF把关节状态和全身安全关系建模得更细。在能获得精确球状态时,Joint-CBF表现更好;只使用固定头部相机时,它的部署成功率降至76%,低于更简单的Link-CBF。
原因很直接:策略被要求学习一套细致的全身约束,输入画面却不足以稳定判断来球状态。把相机换成能够持续追踪球的云台,Joint-CBF的部署成功率回升到90%;如果运行时直接提供精确球状态和安全过滤,成绩还能达到90%至97%。安全结构必须与传感器实际能看到的信息匹配。
论文图4:策略在仿真和实机中形成下蹲、侧倾与横向移动等闪避动作。
95%来自正面20次手掷球
实机测试规模是20次投掷,其中19次成功、1次命中。投掷者位于机器人正面,实验属于受控的短时反应测试。它没有覆盖侧后方来球、多物体连续攻击、拥挤环境或长时间自主行走。
仿真环境采用随机化的来球轨迹,并测试了固定相机、云台相机和精确状态等不同感知条件。实机结果证明,单靠机载深度和本体传感器可以完成这组动作,但95%不能直接外推为开放场景中的通用防撞率。
PAC-MAN更有价值的部分是暴露了一条工程限制:安全控制公式写得更精细,并不自动带来更安全的机器人。相机看不清、目标离开视野或深度信息有噪声时,复杂约束也可能让策略学到更差的动作。研究团队把能够主动追踪来球的硬件云台列为后续工作。