Text to Robotic Assembly of Multi Component Objects using 3D Generative AI and Vision Language Models
通过3D生成AI和视觉语言模型实现多组件物体的文本到机器人组装
机构 * Massachusetts Institute of Technology (MIT)(麻省理工学院) ; MIT(麻省理工学院) ; Google DeepMind(谷歌DeepMind) ; Google, Paradigms of Intelligence(谷歌、范式智能) ; Autodesk Research(Autodesk研究) ; MIT Mechanical Engineering(麻省理工学院机械工程系) ; MIT Architecture(麻省理工学院建筑系) ; MIT CSAIL(麻省理工学院计算机科学与人工智能实验室)
专题命中 视觉推理 :vision language model(title);vision-language model(abstract);VLM(abstract);分类 cs.AI
AI总结 本文提出利用3D生成AI和视觉语言模型实现多组件物体的文本到机器人组装,通过多模态推理分解生成网格并优化组件分配。
Comments Accepted to NeurIPS 2025, Conference on Neural Information Processing Systems, Creative AI Track