arXivDaily arXiv每日学术速递 周一至周五更新

PAPERDAILY REPORTS

蚂蚁南大给机器人补身体常识,32次试验完成率从25%飙到75%

作者:arXivDaily编辑部 arXiv 2609.28530 cs · cs.RO

论文导读

南京大学联合蚂蚁集团、浙江大学提出KnowBody,在不改动视觉语言模型权重的前提下,让机器人拥有一份可查询、可修订的身体关系说明书。四个真机任务、32次固定预算试验中,完成率从原生工具的25%提升到75%。脑子很聪明的VLM终于补上了身体常识这一课。

VLM懂目标,却不懂自己的身体

通用视觉语言模型能理解“把水倒进杯子”这样的任务目标,但它未必知道这台具体机器人的手臂能伸多远、夹爪在哪、各个部件如何配合才能产生想要的效果。结果就是道理都懂、动作翻车:要么够不到,要么用错部位,要么规划出物理上做不到的动作。

团队的出发点不是再训练一个更大的模型,而是把这些与动作相关的身体关系变成显式、可查询、可修订的外部知识,模型权重始终保持冻结。

图:框架图展示冻结的VLM如何通过外部身体模型指导动作选择。

一份会自我修订的身体说明书

KnowBody的身体模型只需用一条与当前任务无关的轨迹初始化。这份不完整的身体模型一方面引导动作选择,另一方面帮助解释过去的交互结果。

工作过程中,新的观测证据会持续精化模型;而那些依赖旧身体估计得出的知识,一旦相关估计被修订,在再次使用前必须重新检查。这样就避免了“身体认知更新了,旧结论却还在用”的错误。

图:关系图展示机器人各功能部件与动作能力之间的显式关联。

32次试验,完成率从25%到75%

团队在四个真实机器人任务上评测,任务包括放鸭子、推苹果、写字、倒水这类日常操作。在32次固定预算试验中,初始化后的KnowBody完成率达75%,而原生工具只有25%。在两种方法都完成的任务里,KnowBody成功所需的规划轮数也更少。

下图给出评测结果,可以直观看出加了身体知识后的显著提升。

图:结果图对比KnowBody与原生工具在四个任务上的完成率和规划轮数。

当开启持续更新后,从第一次到第五次被记录的成功,规划轮数下降29%到53%。说明身体模型会越用越准,机器人对自己能干什么的判断越来越靠谱。

未来落地:给家用机器人配一本可成长的身体手册

这种“冻结模型加显式身体知识”的路线,对低成本部署很有吸引力:不必为每种机器人重新训练大模型,只需初始化并维护对应的身体关系。它天然适合形态多样、任务贴近家庭的服务机器人。

下一步可以研究身体模型在更多形态间的迁移、从极少甚至零轨迹冷启动,以及多人长期使用下知识的安全合并与纠错。当机器人能稳定地认识并更新自己的身体,VLM的通用智能才有了可靠的物理出口。

参考资料

https://arxiv.org/abs/2609.28530

https://arxiv.org/html/2609.28530

↑