MVGGT: Multimodal Visual Geometry Grounded Transformer for Multiview 3D Referring Expression Segmentation
MVGGT:多模态视觉几何 grounded 变换器用于多视角3D指称表达分割
机构 * Key Laboratory of Multimedia Trusted Perception and Efficient Computing, Ministry of Education of China, Xiamen University(厦门大学多媒体可信感知与高效计算教育部重点实验室) ; Shanghai Innovation Institute(上海创新研究院) ; Fudan University(复旦大学) ; ByteDance(字节跳动) ; Tianjin University of Science and Technology(天津科技大学)
AI总结 本文提出MVGGT,一种高效的端到端框架,通过双分支设计将语言信息整合到稀疏视角的几何推理中,解决稀疏视角下的优化障碍,建立首个强基线,实现高精度和快速推理。
Comments Accepted to CVPR 2026; Project Website: https://mvggt.github.io/