arXivDaily arXiv每日学术速递 周一至周五更新

PAPERDAILY REPORTS

同济&中科院让机器人看一张照片就找把手,覆盖473类物体

作者:arXivDaily编辑部 arXiv 2608.20720 cs · cs.CV

“拿住杯把”“按下按钮”“握住喷嘴”都要求机器人把一句自然语言落到物体的具体3D区域。以往方法常假设已经有完整点云和固定动作类别。同济大学与中国科学院提出AffordAny,从一张RGB图片出发重建物体,再根据自由文本定位可操作部位。自动管线最终得到5334个物体、10633个部件样本,覆盖473个类别。

在未见物体上,方法IoU为0.428;未见类别为0.315。伪标签自训练让未见类别mIoU相对提高6.3%,统计检验为p小于0.01。推理仍需要已知的物体二值掩码,并非把任意场景照片直接交给系统就能完成全部检测与重建。

从127万实例筛到473类可交互物体

数据管线从LVIS的1270141个训练实例、1203个类别开始,先保留具有交互意义的类别,再选出7407个候选物体。单张图像经SAM 3D重建,语言模型生成部件指令,多视角标注融合后形成31899组指令级样本。

论文数据图:AffordAny覆盖的日常物体类别及频次分布。

每条数据保留原图、重建几何、相机信息、部件掩码和来源记录,便于追查自动管线在哪一步产生错误。规模比既有封闭类别数据更大,但标签来自多模型自动生成和筛选,不能替代人工逐项标注的精度。

冻结视觉语言模型,只训练1054万参数解码器

AffordAny用冻结的Cosmos-2B提取全局语义和密集视觉特征,把单图重建得到的3D点特征投影进同一空间。文本指令先压成与目标动作相关的语义,再通过双向几何—语义交互,让点云既读取语言,也把局部结构反馈给语义Token。

论文方法图:文字指令、单图视觉特征和SAM 3D几何在解码器中逐步融合。

解码器可训练参数为1054万,冻结的视觉与3D基础模型不计入这一数字。论文报告BF16推理中位延迟16.5毫秒,这同样只指解码器和预计算输入,不包含从原图完成物体分割、SAM 3D重建与VLM特征提取的整条耗时。

自训练改善长尾类别,但绝对重叠仍有限

论文主图:自然语言指定动作后,系统在重建物体上输出部件可供性热力图。

系统用自身预测给新增物体产生伪标签,只接收高置信区域,忽略中间不确定区,并通过教师滑动平均与课程调度控制噪声。未见类别mIoU的相对增幅为6.3%,说明长尾迁移受益;0.315的绝对IoU也表明边界和新类别语义仍有明显误差。

论文结果图:未见物体、未见类别和指令改写条件下的IoU与mIoU对比。

指令改写敏感度差距为0.105,模型对不同说法并非完全稳定。代码仓库已公开训练和评测框架,初版说明同时写明检查点与缓存包尚未包含,不能把仓库存在等同于开箱即用模型。

论文还区分“排序正确”和“区域重叠高”。模型可能把把手点的分数排在杯身之前,却因阈值或概率校准不佳得到低IoU;反过来,大面积涂抹也可能提高重叠。作者同时报告连续热力图与阈值指标,避免用单一数字掩盖两类错误。

自训练新增样本时使用高低双阈值,中间概率区域不参与损失。这样减少错误伪标签的影响,也会丢掉边界和细小部件。喷嘴、按钮等目标面积很小时,阈值策略需要比杯把、椅面更细的类别校准。

下一步接入真实机械臂闭环

当前实验主要评估3D部件重叠,没有直接报告机械臂是否抓取成功。下一步需把热力图交给姿态规划和控制器,在遮挡、透明物体、多个实例和错误掩码下做闭环测试。若单图重建、开放文本和动作规划能在同一延迟预算内运行,家庭机器人和仓储设备才可能真正“看一眼、听一句、找到下手位置”。

数据许可也是部署前提。管线继承LVIS图像和各基础模型的使用条件,自动生成部件标签不改变原图权利。公开数据页需要把图像来源、生成步骤与下游许可一起保留,方便企业判断能否用于商业训练。

参考资料

https://arxiv.org/abs/2608.20720

https://arxiv.org/pdf/2608.20720

https://github.com/lzlfwow/AffordAny

https://modelscope.cn/datasets/lzlfwow/AffordAny