Multilingual Tokenization through the Lens of Indian Languages: Challenges and Insights
通过印度语言的视角看多语言分词:挑战与洞见
机构 * Department of CSE, Indian Institute of Technology Hyderabad(印度理工学院海得拉巴分校计算机科学与工程系) ; Department of CSE, Indian Institute of Technology Bombay(印度理工学院孟买分校计算机科学与工程系) ; SCEE, Indian Institute of Technology Mandi(印度理工学院曼迪分校软件工程系) ; Adobe Research(Adobe研究)
AI总结 本研究针对17种印度语言,系统评估了子词算法、标准化方法、词汇量及词汇构建策略对多语言分词的影响,发现脚本特定标准化、Unigram LM保留形态边界及聚类词汇构建可提升性能。
Comments Accepted at ACL 2026 (Findings - Long paper)