Beyond a Single Extractor: Re-thinking HTML-to-Text Extraction for LLM Pretraining
超越单一提取器:重新思考用于LLM预训练的HTML到文本提取
机构 * Apple(苹果公司) ; Stanford(斯坦福大学) ; University of Washington(华盛顿大学)
AI总结 本文提出通过结合多种提取器提升HTML到文本提取的效率与效果,显著提高LLM预训练数据的token产出并改善下游任务性能。
作者
Natural Language Processing
超越单一提取器:重新思考用于LLM预训练的HTML到文本提取
机构 * Apple(苹果公司) ; Stanford(斯坦福大学) ; University of Washington(华盛顿大学)
AI总结 本文提出通过结合多种提取器提升HTML到文本提取的效率与效果,显著提高LLM预训练数据的token产出并改善下游任务性能。