One Script Instead of Hundreds? On Pretraining Romanized Encoder Language Models
一个脚本而不是数百个?关于预训练罗马化编码语言模型
机构 * Center for Artificial Intelligence and Data Science(人工智能与数据科学中心) ; University of Würzburg(乌尔姆大学)
专题命中 预训练与数据 :language model(title,abstract);pretraining(title,abstract);分类 cs.CL
AI总结 研究通过预训练罗马化和原始文本,探讨罗马化在多语言模型中的有效性,发现分段脚本语言性能损失小,而形态音节脚本语言需更高保真度罗马化以缓解退化。