arXivDaily arXiv每日学术速递 周一至周五更新

PAPERDAILY REPORTS

小米、澳门大学让一个模型控制多种机器人,LIBERO成功率98.3%

作者:arXivDaily编辑部 arXiv 2608.26058 cs · cs.RO

同一个“把面包拿起来”任务,单臂机器人、双臂机器人和人手使用的关节、控制器与动作维度完全不同。小米具身智能团队、澳门大学提出UCAG-P,把这些动作先换算成相机能观察到的手腕、末端执行器和抓取中心轨迹,再交给不同机器人的运动学模块执行。

论文用4030小时机器人与仿真数据、2340小时人类示范训练一个检查点。它在LIBERO取得98.3%成功率,RoboTwin Easy和Hard分别为88.7%和89.2%,零样本LIBERO-Plus为82.0%;这些结果都没有针对单个基准再微调。

先把不同机器人的动作翻译成同一种几何语言

现有跨本体训练常把每套机器人数据接到单独的动作头,或者先将人类视频重定向成机器人轨迹。数据越杂,适配分支越多,共享策略实际学到的内容越少。UCAG-P不让策略直接预测关节角,而是预测相机坐标中的二维、三维锚点运动。

项目页总览:单臂、双臂、人形、灵巧手和人手数据被映射到统一的相机中心动作空间。

几何条件动作翻译器再读取目标机器人的相机外参、雅可比矩阵和当前状态,把共享运动还原成可执行命令。共享策略负责“物体与手应怎样相对移动”,翻译器负责“这台机器具体要动哪些关节”。因此训练数据可以跨外形合并,部署端仍保留本体控制约束。

人类示范和机器人轨迹进入同一个训练流程

人类视频没有机器人关节状态,却包含手在相机中的移动、抓取和放置关系。团队用视觉关键点提取人手锚点,将其与机器人末端锚点对齐;机器人和仿真数据则直接从状态与相机标定中计算几何轨迹。

项目页示意:人手与机器人末端都用相机帧中的视觉锚点和空间轨迹表示。

训练分三段进行:先让策略专门学习相机中心运动,再训练几何到本体动作的翻译,最后联合机器人与人类示范微调。动作命令采用稀疏槽位布局,只激活当前本体需要的维度,避免把不存在的关节也塞进统一向量。

单模型高分不等于每种本体都已解决

单一检查点在四个主基准上保持较高成功率。LIBERO的98.3%最突出;RoboCasa GR-1为62.0%,低于ZR-0的69.3%和JoyAI-RA的63.2%,但高于论文列出的早期基线。不同任务难度和机器人形态差异很大,不能把98.3%外推到所有本体。

项目页基准面板:UCAG-P用同一检查点测试LIBERO、RoboTwin和RoboCasa GR-1等任务。

面对相机、机器人状态、语言、光照、背景、噪声和布局七类扰动,UCAG-P在LIBERO-Plus平均达到82.0%。相机变化仍是较弱项。直接把RoboTwin里的ALOHA替换成ARX时,零样本成功率只有35.0%,说明统一几何能迁移一部分任务关系,机械结构差异仍会损失执行精度。

下一步:验证新相机与新本体部署

真实Piper机器人测试包含抓面包、开抽屉和双臂叠碗,成功率分别为60%、90%和75%;同样示范预算下,复现的π0.5为20%、85%和65%。实机结果支持统一预训练作为初始化,但样本量和实验场景仍是受控桌面任务。

项目页实机实验:抓面包、开抽屉和双臂叠碗的任务设置与成功率。

下一步需要把新相机位置、未见过的夹爪和更大运动范围纳入适配测试。若翻译器能用少量标定和示范接入新本体,共享策略才可能真正减少每换一台机器人就重新训练的成本;35.0%的直接替换结果给出了当前边界。

部署端还要分别统计视觉锚点错误、几何翻译错误和低层控制失败。三类问题现在都会表现为任务失败,若不拆开记录,就无法判断新机器人需要补相机数据、运动学标定,还是需要重新训练共享策略。真实工厂还会遇到相机震动、工具更换和物体堆叠,这些变化比单一基准扰动更复杂。

参考资料

https://arxiv.org/abs/2608.26058

https://arxiv.org/html/2608.26058

https://public-bots.github.io/UCAG-P/