arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~
arXiv 2609.28826cs.CL

COILD:面向印度语言的印地语中心平行语料库与机器翻译基准

COILD: An Indic-Centric Parallel Corpus and Benchmark for Machine Translation Across Indian Languages

  • IIT Patna(印度理工学院巴特那分校)
  • IIT Delhi(印度理工学院德里分校)
  • IIT Guwahati(印度理工学院古瓦哈提分校)
  • IIIT Delhi(德里印度信息学院)
  • MIT-MAHE(马尼帕尔理工学院)
  • IGDTUW(英迪拉·甘地德里女子技术大学)

机构由 AI 辅助整理,请以论文原文为准。

Kshetrimayum Boynao Singh, Nitin Kumar Mishra, Palash Pratim Dutta, Atai Waris Khan, Aparna Kaushik, Avinash Kumar, Deeksha, Deepak Kumar, Saroj Kumar Jha, Salo… 展开作者

Kshetrimayum Boynao Singh, Nitin Kumar Mishra, Palash Pratim Dutta, Atai Waris Khan, Aparna Kaushik, Avinash Kumar, Deeksha, Deepak Kumar, Saroj Kumar Jha, Saloka Sengupta, Anansa Roy, Umalatha Kannoth, Saifulla Samar, Meena Sharma, Manpreet Kaur, Jyoti Sharma, Ashwini Vaidya, Muralikrishna SN, Md Shad Akhtar, Poonam Bansal, Amita Dev, Sanasam Ranbir Singh, Samit Bhattacharya, Tanmoy Chakraborty, Asif Ekbal

AI总结:

针对印度语言机器翻译语料稀缺问题,构建含116万句对的印地语中心平行语料库COILD及2000句专家验证基准,微调IndicTrans2和NLLB-200模型,实验证实其提升翻译性能。

AI中文摘要:

印度语言的机器翻译(MT)仍受到高质量、以印度语言为中心的平行语料库和评估基准稀缺的制约。现有的多语言资源大多基于英语枢轴内容构建,往往无法捕捉印度语言的语言多样性、文化复杂性和领域特定特征。我们提出了COILD,一个以印度语言为中心的平行语料库,包含超过116万个人工翻译且人工验证的句子对,覆盖印度-雅利安语系、达罗毗荼语系、藏缅语系和南亚语系中的20个印度语言对。该语料库完全从原始印度语言来源构建,这些来源收集自八个具有直接现实应用领域的授权资源库。此外,我们引入了一个以领域为中心的基准,包含2000个专家验证的句子,以支持跨印度语言对的一致多语言和跨语言评估。为验证COILD的有效性,我们对两个代表性的多语言神经机器翻译模型IndicTrans2-Distilled和NLLB-200进行了微调。实验结果表明,在语言对、领域、自动评估指标和人工评估方面均取得了一致的改进,凸显了高质量印度语言中心监督的有效性。COILD为推进印度语言的多语言机器翻译和未来的多语言语言模型提供了宝贵的训练和评估资源。

英文摘要:

Machine translation (MT) for Indian languages remains constrained by the limited availability of high-quality, Indic-centric parallel corpora and evaluation benchmarks. Existing multilingual resources are largely constructed from English-pivot content and often fail to capture the linguistic diversity, cultural complexity, and domain-specific characteristics of Indian languages. We present COILD, an Indic-centric parallel corpus comprising over 1.16 million human-translated and human-verified sentence pairs, covering 20 Indian language pairs across the Indo-Aryan, Dravidian, Tibeto-Burman, and Austro-Asiatic language families. The corpus is built entirely from original Indian language sources collected from licensed repositories spanning eight domains with direct real-world applicability. Furthermore, we introduce a domain-centric benchmark comprising 2,000 expert-verified sentences to enable consistent multilingual and cross-lingual evaluation across Indian language pairs. To validate the effectiveness of COILD, we fine-tune two representative multilingual neural machine translation models, IndicTrans2-Distilled and NLLB-200. Experimental results demonstrate consistent improvements across language pairs, domains, automatic evaluation metrics, and human evaluation, highlighting the effectiveness of high-quality Indic-centric supervision. COILD provides a valuable training and evaluation resource for advancing multilingual machine translation and future multilingual language models for Indian languages.

补充信息

↑