发表机构
NASK National Research Institute; University of Innsbruck(NASK国家研究院; 因斯布鲁克大学)
机构由 AI 辅助整理,请以论文原文为准。AI 中文总结
针对方言机器翻译数据稀缺和标准基准不足的问题,本文提出波兰-西里西亚基准SiLTT,并比较基于规则与神经翻译系统,发现基于规则系统在方言场景下表现最优,同时发布模型以促进研究。
AI 中文摘要
方言机器翻译由于数据有限且标准基准通常假设文本为标准化和编辑良好的文本,未能捕捉到强烈的语言变异,因此仍然具有挑战性。我们使用神经和基于规则的系统研究波兰-西里西亚机器翻译,在SiLTT(一个新的波兰-西里西亚测试集)以及已有的BOUQuET和FLORES基准上进行评估。结果表明,我们的基于规则的系统在SiLTT和BOUQuET数据集上始终表现最强,并且在精选数据集上微调的TranslateGemma相比强神经基线有所改进,但在方言环境下未超越基于规则的系统。我们发布SiLTT和我们的最佳神经模型以支持进一步研究。
英文摘要
Dialectal machine translation remains challenging due to limited data and strong linguistic variation not captured by standard benchmarks, which often assume standardized and well-edited text. We study Polish-Silesian MT using neural and rule-based systems, evaluating on SiLTT - a new Pol-Szl testset, alongside established BOUQuET and FLORES benchmarks. Results show our rule-based system is consistently strongest on SiLTT and BOUQuET datasets and that TranslateGemma fine-tuned on a curated dataset improves over strong neural baselines but does not surpass the rule-based system in dialectal settings. We release SiLTT and our best neural model to support further research.
CommentsAccepted at EMNLP 2026 Findings