arXivDaily arXiv每日学术速递 周一至周五更新

PAPERDAILY REPORTS

一个OCR读懂229种语言,复旦腾讯把F1从65.71%拉到80.89%

作者:arXivDaily编辑部 arXiv 2609.24058 cs · cs.CV

论文导读

复旦大学、腾讯微信视觉、华南理工大学提出ScriptMoE,用一个稀疏专家识别器覆盖10种文字体系、229种语言。它替换PP-OCRv5的识别模块后,在CC-OCR多语种任务上把F1从65.71%提高到80.89%,略高于最佳视觉语言模型的80.73%。

多语种OCR的麻烦,发生在识别器内部

街景文字检测先找到文字区域,识别器再把像素变成字符。不同文字体系的字符形状、排列方式和词表差异很大,传统系统常为每种语言部署独立模型;一旦前置语言分类错了,后续识别器也会选错。大型视觉语言模型能统一处理,但参数量和推理成本更高,小语种准确率也未必稳定。

ScriptMoE共用一个视觉编码器,只把解码部分做成稀疏专家。路由器先根据整张文字图判断书写体系,每个样本只激活最相关的两个专家;另有一个共享专家吸收跨文字体系的共同形状知识。部署时仍是一个模型,不需要先猜语言再切换服务。

图:韩文插画输入经过检测与识别后,在右侧标出文字区域并输出结构化转写结果。

1000万合成样本补齐229种语言

现实数据对英语、中文等大语种更丰富,许多语言缺少成规模街景标注。团队构建TextMuSS-10M,覆盖10种文字体系和229种语言,利用合成图像平衡训练监督。对应的TextMuSS-Bench包含10种文字体系、10899张图,用来避免只在合成训练集上看成绩。

单独识别评测中,ScriptMoE准确率82.06%,比最强传统场景文字基线高1.31个百分点。这个提升看似不大,但模型同时承担多文字体系,且每次只启用两个专家。合成数据负责补覆盖,稀疏路由负责把容量分配给不同文字形态。

图:中文、印地语、西里尔、泰语等多种文字的合成样本与真实基准样本并列展示。

只换识别器,端到端F1多了15.18个百分点

更接近产品链路的实验保留PP-OCRv5检测部分,只替换识别器。CC-OCR多语种任务F1从65.71%升到80.89%,最佳视觉语言模型为80.73%。论文强调的是在较小参数规模下取得相近或略高结果,而不是宣称对所有OCR场景全面领先。

路由可视化显示,拉丁、西里尔、阿拉伯等输入会把权重分配给不同专家,同时保留共享专家。它让部署者看到每个样本走了哪条路径,也暴露潜在问题:若输入混合多种文字、字体严重变形或检测框同时包含多行,图像级路由还要面对更复杂的专家选择。

图:不同文字图像对应的Top-2专家权重与有效专家混合比例,颜色区分各专家。

下一步是处理混合文字与真实长尾

TextMuSS-10M主要是合成数据,229种语言的覆盖不等于每种语言都拥有同等丰富的真实场景。后续需要扩大真实招牌、票据、弯曲文字和混合脚本测试,并评估移动端延迟。ScriptMoE已经证明一个统一识别器可以用稀疏专家兼顾覆盖、精度和服务成本。

参考资料

https://arxiv.org/abs/2609.24058

https://arxiv.org/html/2609.24058

https://github.com/YesianRohn/ScriptMoE

https://github.com/Topdu/OpenOCR