arXivDaily arXiv每日学术速递 周一至周五更新

PAPERDAILY REPORTS

人形机器人踩空也能站稳:GigaBrain跌倒恢复率99.3%

arXiv 2608.18234 cs · cs.AI · cs.LG · cs.RO

人形机器人按着坐椅指令下蹲时,椅子可能已经被移走;踢腿动作也可能让自己的四肢互相碰撞。GigaBrain-WBC-0.5把动作、下一时刻身体状态和下一条可行动作分布放进同一个因果Transformer里,让控制器在执行前识别不合理指令并收回到可行范围。论文公开页面未披露作者机构。

作者报告,模型在仿真地形交互中的成功率为81.3%,是不含这套机制的最强对照4.3倍;面对物理上不合理的指令,成功率为83.1%;从倒地初始状态恢复的比例为99.3%。跌倒指标统计的是恢复,不应与另外三类任务的成功率直接横比。

训练数据先补上椅子、箱子和台阶

许多全身跟踪器只在空旷平地训练。动作库里即使有人坐下、撑桌或跨台阶,数据也常常只有人体姿态,没有与之接触的三维物体。控制器因此会把“坐下”学成悬空下蹲,把“扶桌”学成手掌穿过桌面。

GigaBrain从重定向后的普通动作中检测低速接触点,过滤身体穿透,再把接触点聚类并拟合成盒子、平面等三维几何体。椅面、桌面、箱体和台阶由此成为和动作配对的训练地形,而不只是高度图。

从动作恢复三维地形

论文Figure 3:接触检测、点云聚类与几何拟合把普通动作序列转换成带三维接触面的训练样本。

这条自动标注链让已有运动库获得环境约束,但拟合得到的基础几何仍比真实杂乱场景简单。透明、柔软、会移动的物体以及接触摩擦变化没有被同等覆盖。

一个网络同时控制身体并预测“下一步能不能做”

模型输入当前身体状态、上一动作和潜在行为指令。六层因果Transformer输出下一动作、下一身体状态,以及下一条潜在指令的高斯混合分布。部署时,新指令如果落在分布外,系统会把它径向投影回安全椭球,再交给策略执行。

这种“尽力而为”不会简单急停。机器人原本要坐到椅子上,支撑物消失后会改成稳定下蹲;搬箱子时遭遇干扰,它优先保住平衡和手中物体。策略仍可能选择与操作者意图有差异的动作,因此实际产品需要把改写幅度和拒绝原因反馈给上层系统。

支撑缺失和外力干扰下的恢复

论文Figure 7:椅子或平台被移走、外力导致跌倒及高难踢腿时,安全过滤器改变不可行动作。

真实机器人验证了接触能力,不只是在仿真里站住

实机对比让同一操作者同时驱动GigaBrain与SONIC基线。GigaBrain能把箱子当作座面、登上平台、搬起纸箱,还完成跪姿起身并举起2公斤灭火器;对照策略在这些片段中出现半蹲、无法登台、抓取失稳或起身跌倒。

实机环境交互对比

论文Figure 5:同一操作者指令下,GigaBrain与SONIC在坐、登台、搬箱和跪姿起身任务上的硬件对比。

Unitree G1上的检查点还经微调迁移到Maker L01。论文没有把仿真的81.3%、83.1%和99.3%换算成大规模实机成功率,也没有报告长时间连续工作数据;这些数字不能被写成商业部署可靠性。

下一步要把安全投影交给更复杂的上层任务

两种机器人覆盖的动作与任务

论文Figure 8:同一跟踪策略覆盖敏捷动作、家务和工业任务,并在G1与微调后的L01上运行。

这套控制器适合作为远程操作、动作生成模型和人形机器人任务规划器的低层接口:上层给出粗动作,低层负责接触、平衡和可行性。下一阶段需要在会移动的人、散乱物体和不同地面摩擦下测量它何时改写指令、改写后是否仍完成任务。

若要进入真实作业,还应分别报告安全过滤触发率、误拒绝率、跌倒后的物体保持率与跨机体微调成本。当前论文证明的是同一策略能在受控硬件演示中利用环境接触并恢复,不是已经解决开放环境的人形机器人安全。

论文还没有覆盖人群密集、地面持续移动或传感器遮挡等场景,这些条件会同时改变接触判断与安全投影的可用性。

参考资料

https://arxiv.org/abs/2608.18234

https://shepherd1226.github.io/gigabrain-wbc-0.5/