ks-lit-3m: A 3.1 million word kashmiri text dataset for large language model pretraining
ks-lit-3m:一个310万词的克什米尔语文本数据集用于大语言模型预训练
机构 * Independent Researcher(独立研究者)
专题命中 预训练与数据 :large language model(title,abstract);language model(title,abstract);pretraining(title,abstract);分类 cs.CL、cs.AI
AI总结 本文提出KS-LIT-3M数据集,通过开发InPage到Unicode转换器和严格预处理,解决克什米尔语预训练数据稀缺问题,为自然语言处理研究提供高质量资源。