An Empirical Study on Noisy Data and LLM Pretraining Loss Divergence
对噪声数据和LLM预训练损失发散的实证研究
机构 * University of Oxford(牛津大学) ; FAIR at Meta(Meta 的 FAIR)
专题命中 预训练与数据 :LLM(title,abstract);pretraining(title,abstract);large language model(abstract);language model(abstract)
AI总结 本研究通过实证分析揭示噪声数据如何导致LLM预训练中的损失发散,并区分噪声与高学习率引起的发散模式。