X-Tokenizer: A Multimodal Action Tokenizer for Vision-Language-Action Pretraining
X-Tokenizer: 一种用于视觉-语言-动作预训练的多模态动作分词器
机构 * Square Robot ; City University of Hong Kong(香港城市大学) ; Tsinghua University(清华大学)
专题命中 VLM训练与架构 :grounding(abstract);分类 cs.CV、cs.AI、cs.LG
AI总结 提出X-Tokenizer,通过语义残差量化(SRQ)和掩码动作建模(MAM)将动作离散化为语义接口,在2.4M轨迹上预训练后提升VLA模型的多模态接地和长程任务性能。
Comments Project page: https://x-square-robot.github.io/X-Tokenizer_projectPage/