NanoForecast v0.5:通过训练流程优化实现具有竞争力的时间序列预测
NanoForecast v0.5: Competitive Time Series Forecasting Through Training Pipeline Optimization
AI总结:
NanoForecast v0.5通过优化训练流程(修正损失范围、张量形状对齐和增强覆盖)在无架构改动下以650万参数超越31倍规模的TimesFM,MASE降低43.8%,并在ETT和汇率数据集上取得领先。
AI中文摘要:
我们提出了NanoForecast v0.5,一个拥有650万参数的预测器,在训练流程修复且不改变架构的情况下,能够与规模为其31倍的模型(TimesFM,2亿参数)竞争。使用修正后的损失范围处理、张量形状对齐和更广泛的增强覆盖范围重新训练v0.3架构,在相同数据和计算预算下,在固定协议下将整体平均绝对缩放误差降低了43.8%(MASE从3.030降至1.704)。NanoForecast v0.5在全部三个ETT数据集上击败了TimesFM(MASE分别为0.676/1.110/0.287对比0.705/1.360/0.545),在汇率数据集上也获胜(4.317对比4.383);TimesFM在高基数电力数据集和交通数据集上保持明显领先。与PatchTST(1500万以上参数,官方配置)相比,v0.5在全部三个ETT数据集上均获胜。训练在单个云GPU(NVIDIA T4,Google Colab)上约需12小时,推理无需GPU(本文测量在Apple M4 CPU上进行)。我们在Apache 2.0许可下于该https URL发布了所有代码、预训练检查点和评估框架。
英文摘要:
We present NanoForecast v0.5, a 6.5M-parameter forecaster that competes with models 31x its size (TimesFM, 200M parameters) after training pipeline fixes and no architecture change. Retraining the v0.3 architecture with corrected loss-scope handling, tensor shape alignment, and wider augmentation coverage cuts overall Mean Absolute Scaled Error by 43.8% under one fixed protocol (MASE 3.030 to 1.704) on the same data and compute budget. NanoForecast v0.5 beats TimesFM on all three ETT datasets (MASE 0.676/1.110/0.287 vs. 0.705/1.360/0.545) and on exchange rate (4.317 vs. 4.383); TimesFM keeps a clear lead on the high-cardinality electricity and traffic sets. Against PatchTST (15M+ parameters, official configuration), v0.5 wins all three ETT sets. Training takes about 12 hours on a single cloud GPU (NVIDIA T4, Google Colab) and inference needs no GPU (measurements in this paper are on an Apple M4 CPU). We release all code, pretrained checkpoints, and evaluation framework under Apache 2.0 at https://github.com/eulogik/NanoForecast