arXivDaily arXiv每日学术速递 周一至周五更新

PAPERDAILY REPORTS

小米清华教机器人端啤酒,最难新场景成功率多出21.66%

作者:arXivDaily编辑部 arXiv 2609.18119 cs · cs.RO

论文导读

清华大学、小米机器人、苏黎世联邦理工学院和慕尼黑工业大学团队提出平稳搬运液体容器的分层策略。系统先在仿真中生成抓取与路径,再用液体模拟筛掉会倾倒或剧烈晃动的轨迹;相比RVT-2+DP,域内成功率高10.49%,最难域外设置高21.66%。结果仍限定于论文的机械臂、容器和场景。

把杯子送到终点,不等于成功端好一杯水

普通抓取—放置只关心物体最终是否到达目标。液体容器却要求整条轨迹都平稳:加速度突然变化会让液面晃动,杯子倾斜会降低安全余量,即使最后放对位置,中途泼洒也已经失败。人类遥操作示范本身还可能带入手部抖动,不适合直接当作平滑动作标准。

图1:论文项目展示端啤酒任务中泼洒与稳定搬运的对照。

在线强化学习也不容易解决:高精度流体仿真计算昂贵,无法为每一步动作实时提供大量奖励。团队因此把昂贵物理计算前移到数据生产阶段,先离线筛选稳定轨迹,再让策略学习这些经过验证的动作。

抓取、规划、液体模拟,先把不稳定数据淘汰

数据流水线从物体和场景采样开始,用GraspNet生成候选抓取,再让视觉语言模型过滤明显不合理的姿态。通过运动学可行性和避碰检查后,轨迹进入稳定性验证:倾角超过15度会被剔除,液体模拟出现泼洒的样本同样不能进入训练集。

图2:抓取姿态、路径与液体稳定性依次接受过滤。

控制器采用分层扩散策略。高层把语言和视觉观察变成SE(3)控制目标;低层先在紧凑潜空间规划,再解码成稠密动作块,以较高控制频率执行平滑轨迹。这样既避免直接生成很长的高维动作序列,也保留抑制晃动所需的细粒度控制。

下一步:从端啤酒走向安全服务机器人

实验同时考察域内仿真、域外仿真和零样本真实机器人。论文报告,相比RVT-2+DP,所提方法域内成功率提高10.49%,最难域外设置提高21.66%,并在真实环境中完成多种容器的抓取、运输与放置。连续画面显示机械臂会用更平滑的抬升和转移动作控制液面。

图3:域内、域外仿真和零样本实机搬运序列。

标题里的“啤酒”来自项目任务展示,并不意味着系统理解所有液体性质。不同黏度、透明度、容器几何、装液量和机械臂负载都会改变动力学,21.66%也只是特定最难域外设置相对基线的成功率差。研究真正推进的是评价标准:服务机器人不仅要完成终点任务,还应把全过程的动态稳定与安全纳入数据和控制策略。面向餐饮、护理和实验室,后续还需感知实时液面、识别容器损伤,并在人员靠近或抓取松动时主动减速与停止。

参考资料

https://arxiv.org/abs/2609.18119

https://arxiv.org/html/2609.18119

https://fetch-my-beer.github.io/