arXivDaily arXiv每日学术速递 周一至周五更新
海上生明月,天涯共此时!祝大家学得开心,也要注意身体~~

PAPERDAILY REPORTS

机器人先在脑中试错:一个模型同时管硬物、布和绳

作者:arXivDaily编辑部 arXiv 2609.28393 cs · cs.RO

论文导读

明尼苏达大学提出PointCast,用同一种3D点集表示预测刚体、布料、绳索和多关节柜体在机器人动作后的变化。架构只有19.8M参数,在仿真四类体系中三类排名第一、刚体排名第二,并能冻结后放进模型预测控制器中规划动作。

柜门有关节,布和绳还会变形

机器人在动手前预测结果,需要一个世界模型。对刚性积木来说,物体的位姿变了,形状却不变;对柜门来说,可动部分受铰链限制;布料和绳索则有更大的自由度,同一个拉拽动作会引起局部变形。很多方法要针对每种拓扑结构设计独立表示。

PointCast将物体和机器人末端都表示成3D点。每个物体点保持自己的身份,训练时直接监督它的轨迹,而不只检查整个点集的轮廓是否相似。这种表示不需要三角网格,也不预设物体哪些点相连。

图:Figure 2展示物体点、末端执行器点和全局寄存器进入交替局部、全局注意力块,并预测布料未来帧。

局部看邻居,全局看整个物体

模型的注意力在两种范围之间交替。局部注意力只看某个点附近的16个邻居,用来捕捉布面、绳索和物体表面的短距离关系;全局寄存器则读取所有物体点,传递整体形状和远距离联系。每个块还通过交叉注意力读取末端执行器点,学会“夹爪怎么动”与“物体怎么变”之间的耦合。

同一个架构和训练方法覆盖刚体、布、绳和多关节柜体,但四类体系分别训练检查点。它不是一套权重立即通吃四种物体,统一的是表示和建模方式。

图:Figure 4展示刚体、柜体、布和绳索留出轨迹中的真值点云、多个基线预测与PointCast预测。

未来应用:预测模型冻结后,再用它选动作

在真实机器人遥操数据上,PointCast在六个类别中四个平均误差最低,另外两个排名第二,且六类都优于数据集原有模型。仿真检查点零样本迁移到四次真实采集时,其中两次表现最好。

团队又把冻结的PointCast放进采样式模型预测控制。规划器生成候选末端动作,世界模型预测它们对物体点的影响,再挑选更接近目标状态的动作。它在64个仿真回合、四项规划任务上与基线持平或更好。

图:Figure 7将四项规划任务的起始状态、目标区域、末端路径与不同世界模型导致的最终状态并列。

后续部署需要继续压缩长时展开误差,并检验模型在复杂接触、遮挡和新材料上的适应性。如果同一套点集建模方法能继续覆盖更多物体类型,机器人规划器就能少为每种材料重做一套预测系统。

这里的“一个模型”应理解为统一架构,而不是一份权重同时控制所有材料。四类物体分别训练检查点,真实数据评测和仿真规划评测也承担不同作用。对实际系统而言,统一表示可以减少工程接口,但部署前仍要判断当前物体属于哪一类、点云是否完整,以及模型滚动预测多久后开始漂移。特别是布料和绳索,一次局部预测误差会沿规划时域累积,安全系统不能只依据最终目标误差来选动作。

参考资料

https://arxiv.org/abs/2609.28393

https://pointcast-wm.github.io

↑