Learn from your own latents and not from tokens: A sample-complexity theory
从自身潜在表示而非token学习:样本复杂度理论
机构 * Institute of Physics(物理研究所) ; University of Cambridge(剑桥大学) ; Johns Hopkins University(约翰霍普金斯大学) ; EPFL(苏黎世联邦理工学院)
专题命中 预训练与数据 :large language model(abstract);language model(abstract);分类 cs.LG
AI总结 本文通过概率上下文无关语法数据,证明潜在预测方法在样本复杂度上相比token级SSL具有指数级优势,并分析了多尺度层次结构的必要性。
Comments 10 pages, 5 figures in main. 28 pages, 14 figures, 1 table in all