arXivDaily arXiv每日学术速递 周一至周五更新

PAPERDAILY REPORTS

北大等让宇树G1边走边干活,完整任务成功率提高10个百分点

作者:arXivDaily编辑部 arXiv 2609.06251 cs · cs.CV · cs.RO

论文导读

北京大学、华南理工大学、新加坡国立大学联合提出MobileVLA-R1 2.0,让移动机器人先理解指令和环境,再输出能执行的导航与操作命令。宇树G1在论文设定的真实移动操作任务中,完整任务成功率比上一版提高10个百分点。它回答的是机器人怎样把“想清楚”和“动起来”接好,成绩不能外推到任意家庭环境。

边走边抓,难在两套能力必须连续接上

让机器人“把水果放进柜子”听起来只有一句话,实际要连续完成搜索、走近目标、调整身体、伸手抓取、搬运和放置。导航稍微偏一点,机械手就够不到;抓取动作成功,移动底盘没有停稳,同样会让完整任务失败。过去不少视觉—语言—动作模型直接从观察预测动作,长任务中的推理和控制容易脱节。

MobileVLA-R1 2.0把输出拆成任务级命令:模型负责判断下一步要导航、对齐、抓取还是放置,具体关节与速度再交给不同机器人的控制器。这样,同一套高层接口可以接宇树Go2四足机器人,也可以接带灵巧手的G1人形机器人。

图1:论文Figure 10展示G1在杂乱、货架与桌面场景中从导航到抓取、搬运和放置的连续实机过程。

先把任务讲成步骤,再用奖励校正动作

训练的第一部分是一套多粒度推理数据。团队根据图像、深度、语言指令和已有动作,把一段任务整理成整段计划、当前步骤判断以及导航层面的执行目标,并通过自动解析和半自动检查清理格式错误。模型先学会按固定结构说明当前处境与下一步动作,避免只记住某个场景里的运动轨迹。

图2:论文Figure 1展示从多模态观察和指令生成整段、单步与导航级推理记录,再进行质量检查的流程。

第二部分用强化学习继续校正“推理是否真的能落到动作”。模型一次生成多组结构化答案,训练程序根据移动方向、行为选择和输出格式打分。随后,推理条件动作解码器把模型内部信息变成前后、横向、转向速度和离散行为命令。这里的推理文本不是展示用途,它必须和机器人最终执行的命令保持一致。

G1完整成功率提高10个百分点

论文同时测试了仿真导航、Go2四足平台和G1移动操作。语言导航基准上的平均成功率提高1.6个百分点;更直观的变化出现在G1实机任务:相对MobileVLA-R1,完整任务成功率提高10.0个百分点。完整成功要求机器人把一串步骤全部做完,比只统计单次抓取或局部导航更严格。

图3:论文Figure 7给出G1、深度相机、灵巧手和Jetson Orin NX等硬件,以及模型到任务级命令的部署链路。

这些实验仍在论文规定的室内物体、机位和任务流程中完成。10个百分点说明新版接口在这组长链条任务中更稳,不代表机器人已经能在开放家庭里处理任意物体、任意说法和突发情况。

下一步是把任务级接口带到更多机器人

这套设计的实用点在于把高层判断和具体机器人控制分开。研究者可以保留同一套视觉、语言和任务规划模块,再为不同底盘、机械臂或灵巧手配置控制器。后续需要观察的是:换到更多光照、房间布局和物体后,完整成功率能否保持;远程大模型计算的时延与断连,也要纳入真实部署评测。只有这些条件一起稳定,边走边操作才会从受控实验走向长期运行。

参考资料

https://arxiv.org/abs/2609.06251

https://arxiv.org/html/2609.06251

https://aigeeksgroup.github.io/MobileVLA-R1-2.0/