ROCKET: Residual-Oriented Multi-Layer Alignment for Spatially-Aware Vision-Language-Action Models
ROCKET:基于残差的多层对齐用于空间感知的视觉-语言-动作模型
机构 * University of Maryland, College Park ; University of Wisconsin, Madison ; City University of Hong Kong ; St.\ Paul's School
AI总结 ROCKET通过共享投影器和稀疏激活方案实现多层对齐,提升3D空间理解能力,在LIBERO等任务中达到98.5%的高成功率。