arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~
arXiv 2609.13277cs.CVcs.LG

SomBench:推进月球科学机器学习的基准数据集

SomBench: Benchmark Dataset for Advancing Machine Learning in Lunar Science

  • The University of Alabama in Huntsville(阿拉巴马大学亨茨维尔分校)
  • IBM Research(IBM研究院)
  • Science and Technology Institute, Universities Space Research Association (USRA)(大学空间研究协会科学技术研究所)
  • NASA Goddard Space Flight Center(美国国家航空航天局戈达德太空飞行中心)
  • SETI Institute(搜寻地外文明研究所)
  • NASA Ames Research Center(美国国家航空航天局艾姆斯研究中心)
  • University of Maryland, Baltimore County (UMBC)(马里兰大学巴尔的摩县分校)
  • Howard University(霍华德大学)

机构由 AI 辅助整理,请以论文原文为准。

Himanshu Patil, Gabby Nyirjesy, Rachel A. Slank, Vishal Gaur, Daniela Szwarcman, Paolo Fraccaro, Nikolaos Dionelis, Michael K. Barker, Andrew Annex, Vishnu Visw… 展开作者

Himanshu Patil, Gabby Nyirjesy, Rachel A. Slank, Vishal Gaur, Daniela Szwarcman, Paolo Fraccaro, Nikolaos Dionelis, Michael K. Barker, Andrew Annex, Vishnu Viswanathan, Zachary Morse, Ethan I. Schaefer, Hiyam Debary, Ankur Kumar, Rohit Lal, Geoffrey Dawson, Campbell Watson, Rebekah I. Dawson-Rigas, Manil Maskey, Juan Bernabé-Moreno, Rahul Ramachandran, Sujit Roy

AI总结:

SomBench是一个统一、空间对齐的月球科学机器学习基准数据集,聚合多任务多仪器数据,提供防泄漏分块和覆盖撞击、火山、极地挥发物的任务套件,基线实验验证了任务可学习性。

AI中文摘要:

月球轨道任务,如月球勘测轨道飞行器、辉夜姬/月女神号、重力恢复与内部实验室以及月球勘探者等,提供了丰富的多仪器观测数据,但它们在采样、投影和惯例上的异质性限制了可复现的机器学习(ML)。我们推出了SomBench,一个统一、空间对齐、可直接用于ML的月球数据集,聚合了来自四个任务的十种仪器的30多个共同配准图层,覆盖从1米到20公里/像素的分辨率,跨越82度纬度,分布在90个月球横轴墨卡托分区和两个极地立体投影盖中。一个基于图像锚定的分块流程生成了可预训练的多模态分块视图,并带有防泄漏的数据划分,以netCDF格式分发并附带Parquet目录。一个应用基准套件涵盖撞击过程、火山历史和极地挥发物。使用ResNet-50和SwinV2-B模型的基线实验确认每个基准任务可从发布的数据中学习,为未来模型开发建立了参考点。

英文摘要:

Lunar orbital missions, such as Lunar Reconnaissance Orbiter, Kaguya/SELENE, Gravity Recovery and Interior Laboratory, and Lunar Prospector, among others, provide rich multi-instrument observations, but their heterogeneity in sampling, projection, and conventions limits reproducible machine learning (ML). We introduce SomBench, a unified, spatially-aligned, ML-ready lunar dataset aggregating 30+ co-registered layers from ten instruments across four missions, spanning 1 meter to 20 kilometer/pixel and covering 82 degree latitude in 90 Lunar Transverse Mercator zones with two polar stereographic caps. An image-anchored tiling pipeline yields pretraining-ready multimodal tile views with leakage-safe splits, distributed as netCDF with Parquet catalogs. An application benchmark suite spans impact processes, volcanic history, and polar volatiles. Baseline experiments with ResNet-50 and SwinV2-B models confirm that each benchmark task is learnable from the released inputs, establishing reference points for future model development.

↑