4DLangVGGT: 4D Language-Visual Geometry Grounded Transformer
4DLangVGGT: 4D语言-视觉几何 grounded Transformer
机构 * State Key Laboratory of Precision Blasting, Jianghan University(江汉大学精密爆破重点实验室) ; Harvard AI and Robotics Lab, Harvard University(哈佛大学AI与机器人实验室) ; School of EIC, Huazhong University of Science and Technology(华中科技大学电子信息学院) ; Department of Computing, The Hong Kong Polytechnic University(香港理工大学计算机系) ; Department of Computer Science, Hong Kong Baptist University(香港 Baptist 大学计算机科学系) ; School of Mathematics and Statistics, Hubei University of Education(湖北省教育学院数学与统计学学院)
AI总结 4DLangVGGT是一种基于Transformer的统一框架,用于4D语言 grounding,通过整合几何感知和语言对齐,提升4D场景理解的泛化能力和部署效率。
Comments Code: https://github.com/hustvl/4DLangVGGT, Webpage: https://hustvl.github.io/4DLangVGGT