论文导读
小鹏、北京大学与香港大学提出GroundingPI,把点、框、掌握点和密集定位收进同一个4B视觉骨干。它在34项定位基准上平均73.68%,还在机器人与驾驶任务中展现数据效率;这些结论局限于论文设定的模型、数据和评测。
一套坐标表达多种“找到它”
机器人下手前,不只要识别“杯子”,还要知道杯子在哪里、哪一点能接触、哪块区域可以操作。GroundingPI用统一坐标序列表达不同粒度的空间答案,让预训练获得的视觉能力可被机器人策略直接调用。它把指代表达、目标框、关键点与密集区域放进共同训练配方,重点不是再做一个会聊天的视觉模型,而是提供可以落到动作上的空间接口。
图:论文案例在街头摊位与密集图形中比较目标定位,展示细小对象和杂乱背景带来的难度。
小模型追的是可用的空间理解
论文集中检查指令定位、物体框选和密集对应。作者报告,4B版本在34项基准上平均73.68%,并在部分设定下对更大模型保持竞争力。这个平均数是多个数据集的汇总,不代表每类场景都有相同准确率;更重要的是,小模型在细粒度目标和操作相关位置上没有因为体量缩小而完全失去能力。
图:室内沙发场景对照真值与模型输出,可直接检查被语言指定的区域是否对齐。
定位能力开始换算成机器人数据
作者将骨干接入下游机器人学习,比较不同演示数量下的表现。论文给出的信号是:预训练时已经把“指的是哪里”学好,下游不必完全依赖大量真机演示重头建立对应。部分实验中,GroundingPI使用50%演示数据便超过使用75%数据的对照;但节省比例依赖具体任务、策略和基线,不能外推到任意机器人平台。
图:密集排版样例展示模型在多目标干扰下的区域对齐,与自然场景形成另一类视觉证据。
下一步是在真实闭环中检验
真正影响机器人成本的,不是单帧框得准,而是连续操作中的对象持续性、遮挡恢复和失败纠正。后续需要在新环境、新目标与真机闭环里重复数据效率对照,同时测量误抓和碰撞,才能判断这套视觉骨干究竟能减少多少采集与标注。
对开发团队而言,最直接的使用方式不是一次替换整套感知系统,而是先把GroundingPI作为候选目标生成器,与现有检测器和人工标注并行运行。可以分别统计小物体、遮挡目标、文字区域和操作关键点的召回,再观察这些改进是否真正传到抓取成功率。若视觉分数提高而真机没有变化,就应继续检查坐标接口、控制频率和策略训练,而不是把问题归因于模型规模。跨场景评测也要保留失败样例,防止平均分掩盖少数高风险误定位。