重新思考手写字符识别
Rethinking Handwritten Character Recognition
浏览论文内容
中文总结 AI 辅助
提出GraphemeNet,通过持久支架注入和笔画拓扑模块显式编码文字几何结构,在14个基准上超越基线,验证了结构先验效率原则。
中文摘要 AI 辅助
非拉丁手写字符识别(HCR)仍研究不足。主流方法将其视为通用图像分类,依靠模型规模隐式学习笔画结构。结构先验效率原则——即显式地将文字几何规律编码为架构归纳偏置,既能提高准确率,又能减少参数。我们提出GraphemeNet,一种统一的多文字架构,由两个正交的二元轴控制。轴1通过持久支架注入(PSI)实现笔画级几何规律:一种特定于文字的对称卷积在每个编码器阶段将笔画支架作为加权残差注入,持续将学习到的特征锚定到文字几何上——这不同于跳跃连接、辅助损失或注意力重加权。轴2根据字形判别是否需要空间关系推理,在带门控融合的全局平均池化和带笔画拓扑模块(STM)的跨尺度注意力之间进行选择。线性胶囊路由(LCR)采用O(n)路由,通用共享。在涵盖八种书写系统的十四个基准上,该架构仅需按文字调整支架和解码器拓扑即可泛化,持续挑战并超越已发表的基线,确立了结构先验效率作为多文字HCR广泛适用原则的地位。
英文摘要
Non-Latin handwritten character recognition (HCR) remains understudied. Dominant methods consider it as generic image classification, which uses model scale to implicitly learn stroke structure. Structural-prior efficiency---the principle that explicitly encoding script-geometric regularities as architectural inductive biases can be both more accurate and require fewer parameters. We introduce GraphemeNet, a unified multi-script architecture, governed by two orthogonal binary axes. Axis 1 operationalises stroke-level geometric regularity via Persistent Scaffold Injection (PSI): a script-specific asymmetric convolution injects a stroke scaffold as a weighted residual at every encoder stage, continuously anchoring learned features to script geometry---distinct from skip connections, auxiliary losses, or attention reweighting. Axis 2 selects between global average pooling with gated fusion and cross-scale attention with a Stroke Topology Module (STM), depending on whether glyph discrimination requires spatial relational reasoning. A Linear Capsule Routing (LCR) with $O(n)$ routing is shared universally. On fourteen benchmarks across eight writing systems, the architecture generalises with only scaffold and decoder topology varying per script, consistently challenging, outperforming published baselines, and establishing structural-prior efficiency as a broadly applicable principle for multi-script HCR.
发表机构
- Kathmandu University(加德满都大学)
机构由 AI 辅助整理,请以论文原文为准。