发表机构
NLPR, Institute of Automation, Chinese Academy of Sciences; Peking University; Tsinghua University; Galbot Inc.; Shanghai Jiao Tong University; Beijing Academy of Artificial Intelligence(中国科学院自动化研究所模式识别国家重点实验室; 北京大学; 清华大学; 北京银河通用机器人有限公司; 上海交通大学; 北京智源人工智能研究院)
机构由 AI 辅助整理,请以论文原文为准。AI 中文总结
提出UniPart,一种以CLIP文本嵌入为条件的跨模态三维Transformer,实现零样本语言引导的部件分割,并构建大规模数据集LangPart-1M及高质量子集LangPart-4K,在开放词汇基准和真实抓取中表现优异。
AI 中文摘要
细粒度机器人操作依赖于对部件的理解,而不仅仅是整个物体。现有的三维基础模型要么具有泛化能力但仅感知物体,要么能感知部件但局限于封闭集分类体系,这削弱了零样本迁移能力。我们研究文本条件下的三维部件分割,即自由形式的短语在点云上选择功能部件。我们提出了UniPart,一种以前馈方式运行的跨模态三维Transformer,它以CLIP文本嵌入为条件。为了扩展监督,我们构建了LangPart-1M数据集,利用多视角一致的部件生成方法,包含160K多个Objaverse资产和800万个文本到部件对。我们进一步手动标注了一个高质量子集LangPart-4K,用于微调和评估。UniPart在开放词汇部件基准上取得了强大的零样本结果,并在真实世界中成功迁移到语言条件下的部件抓取任务。
英文摘要
Fine-grained robotic manipulation depends on understanding parts, not only whole objects. Existing 3D foundation models tend to be either generalized but object-aware, or part-aware but limited to closed-set taxonomies, which weakens zero-shot transfer. We study text-conditioned 3D part segmentation, where a free-form phrase selects a functional part on point cloud. We introduce UniPart, a feed-forward cross-modal 3D Transformer that conditions CLIP text embedding. To scale supervision, we build LangPart-1M with 160K+ Objaverse assets and 8M text to part pairs using multi-view consistent part generation. We further manually label a high-quality subset, LangPart-4K, for fine-tuning and evaluation. UniPart achieves strong zero-shot results on open-vocabulary part benchmarks and transfers to language-conditioned part grasping in real world.