SomBench:推进月球科学机器学习的基准数据集
SomBench: Benchmark Dataset for Advancing Machine Learning in Lunar Science
- The University of Alabama in Huntsville(阿拉巴马大学亨茨维尔分校)
- IBM Research(IBM研究院)
- Science and Technology Institute, Universities Space Research Association (USRA)(大学空间研究协会科学技术研究所)
- NASA Goddard Space Flight Center(美国国家航空航天局戈达德太空飞行中心)
- SETI Institute(搜寻地外文明研究所)
- NASA Ames Research Center(美国国家航空航天局艾姆斯研究中心)
- University of Maryland, Baltimore County (UMBC)(马里兰大学巴尔的摩县分校)
- Howard University(霍华德大学)
机构由 AI 辅助整理,请以论文原文为准。
AI总结:
SomBench是一个统一、空间对齐的月球科学机器学习基准数据集,聚合多任务多仪器数据,提供防泄漏分块和覆盖撞击、火山、极地挥发物的任务套件,基线实验验证了任务可学习性。
AI中文摘要:
月球轨道任务,如月球勘测轨道飞行器、辉夜姬/月女神号、重力恢复与内部实验室以及月球勘探者等,提供了丰富的多仪器观测数据,但它们在采样、投影和惯例上的异质性限制了可复现的机器学习(ML)。我们推出了SomBench,一个统一、空间对齐、可直接用于ML的月球数据集,聚合了来自四个任务的十种仪器的30多个共同配准图层,覆盖从1米到20公里/像素的分辨率,跨越82度纬度,分布在90个月球横轴墨卡托分区和两个极地立体投影盖中。一个基于图像锚定的分块流程生成了可预训练的多模态分块视图,并带有防泄漏的数据划分,以netCDF格式分发并附带Parquet目录。一个应用基准套件涵盖撞击过程、火山历史和极地挥发物。使用ResNet-50和SwinV2-B模型的基线实验确认每个基准任务可从发布的数据中学习,为未来模型开发建立了参考点。
英文摘要:
Lunar orbital missions, such as Lunar Reconnaissance Orbiter, Kaguya/SELENE, Gravity Recovery and Interior Laboratory, and Lunar Prospector, among others, provide rich multi-instrument observations, but their heterogeneity in sampling, projection, and conventions limits reproducible machine learning (ML). We introduce SomBench, a unified, spatially-aligned, ML-ready lunar dataset aggregating 30+ co-registered layers from ten instruments across four missions, spanning 1 meter to 20 kilometer/pixel and covering 82 degree latitude in 90 Lunar Transverse Mercator zones with two polar stereographic caps. An image-anchored tiling pipeline yields pretraining-ready multimodal tile views with leakage-safe splits, distributed as netCDF with Parquet catalogs. An application benchmark suite spans impact processes, volcanic history, and polar volatiles. Baseline experiments with ResNet-50 and SwinV2-B models confirm that each benchmark task is learnable from the released inputs, establishing reference points for future model development.