一张表单里,“项目名称”对应哪段长文本、一个字段是否连着多个值,传统流程通常先OCR,再做实体识别与关系抽取。IBM苏黎世研究院和苏黎世联邦理工提出端到端方案,微调2.56亿参数SmolDocling,直接从文档图片生成键、值、边界框和连接关系。它比Qwen2.5-VL 7B小27倍,在A100上的推理速度快5倍以上。
论文没有宣称全面替代OCR系统。新模型在布局感知评测中超过数个零样本视觉语言模型,但仍落后于依赖OCR文本与布局输入的专用编码器;模型权重计划在论文正式发表后公开,目前不能写成已经开源。
一次输出识别、定位和关联
系统扩展DocTags格式,增加键值区域、键、值和有向链接四类标签。每个元素带唯一标识和归一化边界框,模型可以表达一个键对应多个值、一个值继续充当下级键的关系,最终形成有向图,而非一段需要再次解析的自然语言。模型接收的是尚未叠加预测框与连线的原始文档页。
论文输入样例:一张未叠加预测标记的普通表单页,包含姓名、签名与日期等字段。
视觉编码器约9100万参数,语言解码器SmolLM2约1.35亿参数,加上投影层后总计2.56亿。全部参数参与微调。输出同时包含文本和位置,因此评测不只看字符串是否相似,还要求预测框与真实框的交并比至少达到0.7。
合成填表和完整子图裁剪补数据
键值关系标注比普通OCR数据少。团队先把空白表单自动填入合成内容,保留原有布局;再按关系图裁剪局部区域,但只保留完整键值子图,避免一个裁剪把键留下、对应值切掉。
论文定性结果:模型同时预测多组字段的文字框和指向关系。
消融实验中,仅加入图结构裁剪,XFUND关系抽取F1从0.122升至0.172,相对提高约41%。合成填表对FUNSD和XFUND均有稳定贡献。空间排序还让FUNSD的语义实体识别提高1.4个百分点,说明同一串标签中元素的排列会影响解码。
小模型赢的是零样本VLM而非所有专用系统
论文定性案例:同一文档区域内包含多组长文本值和多对多连接。
实验覆盖FUNSD、XFUND和一个大规模私有数据集。布局感知协议下,2.56亿参数模型超过Qwen2.5-VL 7B等零样本基线;论文报告A100单样本推理约1.40秒,速度超过后者5倍。模型小并不自动等于手机端实时,测试仍使用数据中心GPU。
OCR加专用编码器的方案能直接利用高质量文字Token,当前模型的字符识别和空间推理还没追平它们。私有数据集也限制了外部复核范围,因此公开基准结果比“企业文档表现”更适合做横向判断。
从表单抽取走向设备端文档流程
论文方法图:文档图片经视觉编码和投影后,由语言解码器生成带位置与链接的DocTags。
作者计划把模型扩到10亿至70亿参数,改善OCR准确率、空间推理和复杂关系建模;2.56亿版本则保留设备端部署候选的体量。实际落地还要验证扫描噪声、多语种、手写体和长表单,并将结构化输出接入发票录入、合同字段抽取和档案检索流程。
布局感知评测也改变了“答对”的定义。若模型抄出了正确文字,却把它连接到页面上另一个同名字段,文本匹配可能给分,加入边界框后就会判错。重复字段、跨栏表格和多对多关系因此更接近真实业务难点。
论文在8张NVIDIA A100上完成微调,有效批量为32,全部视觉、投影和语言参数解冻。2.56亿参数降低了模型体量,却没有消除训练成本。所谓设备端候选主要指模型规模,文中没有给出手机CPU、NPU或浏览器端的速度与内存数据。
私有数据集用于补充企业复杂表单,但外部读者无法复算这一部分。部署方更适合先在FUNSD、XFUND和自有人工抽样集上分别测实体、位置与关系错误,再决定是否替换现有OCR管线。
参考资料
https://arxiv.org/abs/2608.20868