DriveTok: 3D Driving Scene Tokenization for Unified Multi-View Reconstruction and Understanding
DriveTok: 3D驾驶场景分词用于统一多视角重建与理解
机构 * Tsinghua University(清华大学) ; Yinwang Intelligent Technology Co. Ltd.(云网智能科技有限公司)
专题命中 VLA模型 :vision-language-action(abstract);action model(abstract);分类 cs.CV、cs.LG
AI总结 DriveTok通过3D变形交叉注意力实现高效多视角重建与理解,整合语义、几何与纹理信息,提升多视角分词效率与一致性。
Comments Project Page: https://paryi555.github.io/DriveTok/ Code: https://github.com/paryi555/DriveTok