发表机构
European Centre for Medium-Range Weather Forecasts(欧洲中期天气预报中心)
机构由 AI 辅助整理,请以论文原文为准。AI 中文总结
本文提出紧凑多模态混合专家模型MEOX,采用特定传感器适配器等技术,在122.8万MMEarth64样本上预训练,在多项地球观测基准任务中性能优于CSMoE,实现了传感器灵活的表征学习与任务迁移。
AI 中文摘要
地球观测表征学习的最新进展可适配异构传感器与缺失观测,通常依赖更大规模的架构。本文提出MEOX(Multimodal Earth Observation with eXperts,多模态地球观测混合专家模型),这是一种多模态掩码自编码器,其编码器参数规模为293.9万,总参数规模达311.5万。在学习到的逐片融合之前,特定传感器适配器、显式有效性信号与共享稀疏专家块可保留模态相关的处理逻辑。随后,4个元数据标记伴随单个空间序列通过另外14个编码器块。带私有低秩残差的共享专家投影可限制参数增长,而旋转注意力支持与预训练时不同的下游空间网格。该模型在122.8万个MMEarth64样本上,采用模态平衡掩码重构与结构化传感器弃权(不执行)进行预训练。在64像素和224像素两种分辨率下,对6项GEO-Bench任务评估冻结迁移效果:在64像素分辨率下的腰果分割任务中,模型达到64.42%的平均交并比;在224像素分辨率下的EuroSAT任务中,达到90.56%的平均准确率,超过已报道的CSMoE对应结果;BigEarthNet微调则达到72.95%的微平均精度。路由诊断可区分专家参与度、空间依赖性、模态关联与功能贡献;保留的WorldCover探针显示元数据带来0.64个百分点的收益,而检索可区分同传感器语义与跨传感器对齐。这些结果表明,该模型在紧凑参数预算下,实现了传感器灵活的表征学习与出色的任务迁移能力。
英文摘要
Recent advances in Earth Observation representation learning accommodate heterogeneous sensors and missing observations, often through larger architectures. We present MEOX (Multimodal Earth Observation with eXperts), a multimodal masked autoencoder with a 2.939 million-parameter encoder and 3.115 million parameters in total. Sensor-specific adapters, explicit validity signals, and a shared sparse-expert block preserve modality-dependent processing before a learned patch-wise fusion. Four metadata tokens then accompany a single spatial sequence through fourteen further encoder blocks. Shared expert projections with private low-rank residuals constrain parameter growth, while rotary attention supports downstream spatial grids different from pretraining. The model is pretrained on 1.228 million MMEarth64 samples using modality-balanced masked reconstruction and structured sensor dropout. Frozen transfer is evaluated on six GEO-Bench tasks at both 64 and 224 pixels. The model reaches 64.42% mean intersection-over-union on cashew segmentation at 64 pixels and 90.56% average accuracy on EuroSAT at 224 pixels, exceeding the corresponding reported CSMoE results. BigEarthNet finetuning reaches 72.95% micro-average precision. Routing diagnostics distinguish expert participation, spatial dependence, modality association, and functional contribution. A held-out WorldCover probe measures a 0.64-percentage-point benefit from metadata, while retrieval separates same-sensor semantics from cross-sensor alignment. These results demonstrate sensor-flexible representation learning and strong task transfer using a compact parameter budget.