arXivDaily arXiv每日学术速递 周一至周五更新

大厂专区

2026-06-23 至 2026-06-23 共收录 1
2506.17789 2026-06-23 cs.CL 版本更新

Multilingual Tokenization through the Lens of Indian Languages: Challenges and Insights

通过印度语言的视角看多语言分词:挑战与洞见

Maharaj Brahma, N J Karthika, Rajat Verma, Nagasai Saketh Naidu, Rohit Saluja, Maunendra Sankar Desarkar, Ganesh Ramakrishnan

机构 * Department of CSE, Indian Institute of Technology Hyderabad(印度理工学院海得拉巴分校计算机科学与工程系) Department of CSE, Indian Institute of Technology Bombay(印度理工学院孟买分校计算机科学与工程系) SCEE, Indian Institute of Technology Mandi(印度理工学院曼迪分校软件工程系) Adobe Research(Adobe研究)

AI总结 本研究针对17种印度语言,系统评估了子词算法、标准化方法、词汇量及词汇构建策略对多语言分词的影响,发现脚本特定标准化、Unigram LM保留形态边界及聚类词汇构建可提升性能。

Comments Accepted at ACL 2026 (Findings - Long paper)

详情

展开后加载摘要…

URL PDF HTML 收藏