arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

QUALS:通过模式量化和可学习性同步实现通用预测的语料库均衡

QUALS: Corpus Equilibrium for Universal Forecasting via Pattern Quantization and Learnability Synchronization

Yujie Li, Zezhi Shao, Chengqing Yu, Yisong Fu, Weijie Zhu, Yifan Du, Jilin Hu, Bin Yang, Yongjun Xu, Fei Wang

arXiv 2609.20156首次发表:更新:

发表机构

State Key Laboratory of AI Safety, Institute of Computing Technology, Chinese Academy of Sciences; University of Chinese Academy of Sciences; School of Data Science and Engineering, East China Normal University(中国科学院计算技术研究所人工智能安全国家重点实验室; 中国科学院大学; 华东师范大学数据科学与工程学院)

机构由 AI 辅助整理,请以论文原文为准。

AI 中文总结

针对时间序列预测中数据多样性不足的问题,提出QUALS语料库均衡框架,通过模式量化和可学习性同步提升数据效率,使现有模型在少量数据下实现优越零样本预测。

AI 中文摘要

跨多个领域的普遍时间序列数据使得交通系统和电网等领域的应用成为可能。最近,在大型数据集上训练基础模型以实现准确的零样本预测已成为一个主要的研究焦点。然而,当前研究主要优先考虑架构创新,而对数据多样性的关注不足,往往依赖简单的数据采样策略,这些策略无法有效管理复杂的数据分布,导致训练数据使用效率低下和性能欠佳。为解决这一问题,我们提出了QUALS,一个大规模时间序列语料库均衡框架。QUALS显著提升了数据效率,即,使现有模型仅使用原始训练数据的一小部分就能实现优越的性能。具体来说,QUALS通过两个核心机制运作。首先,一个模式量化框架通过向量量化和均匀分箱系统地从混合语料库中解码异质模式。其次,一个可学习性同步框架校准异质模式的采样权重,弥合简单与复杂模式之间的优化差距,以最大化整体训练效率。广泛的基准测试表明,在QUALS上预训练持续实现优越的零样本性能,即使在大幅减少的训练预算下也是如此。

英文摘要

Ubiquitous time series data across diverse domains enables critical applications in areas such as transportation systems and power grids. Recently, training foundation models on massive datasets to achieve accurate zero-shot forecasting has emerged as a major research focus. However, current studies predominantly prioritize architectural innovations while insufficiently addressing data diversity, often relying on simple data sampling strategies that fail to manage complex data distributions effectively, leading to inefficient use of training data and suboptimal performance. To address this, we propose QUALS, a large-scale time series corpus equilibrium framework. QUALS significantly enhances data efficiency, i.e., enabling existing models to achieve superior performance using only a small fraction of the original training data. Specifically, QUALS operates through two core mechanisms. First, a pattern quantization framework systematically decodes heterogeneous patterns from mixed corpora via vector quantization and uniform binning. Second, a learnability synchronization framework calibrates sampling weights for heterogeneous patterns, bridging the optimization gap between simple and complex motifs to maximize overall training efficiency. Extensive benchmarks demonstrate that pre-training on QUALS consistently achieves superior zero-shot performance, even under substantially reduced training budgets.

CommentsAccepted by VLDB 2027

论文原文

arXiv 摘要页 · PDF 原文 · HTML 原文

↑