Enhancing Multilingual LLM Pretraining with Model-Based Data Selection
通过基于模型的数据选择增强多语言大语言模型预训练
机构 * EPFL(苏黎世联邦理工学院)
专题命中 预训练与数据 :LLM(title,abstract);pretraining(title,abstract);large language model(abstract);language model(abstract)
AI总结 本文提出了一种基于模型的数据选择框架,通过提高多语言大语言模型预训练的效果,实现了在较少训练数据下达到基线分数并提升其他基准测试的表现。
Comments NeurIPS 2025 Track on Datasets and Benchmarks