Identify, Locate, Link: End-to-End Key-Value Extraction from Document Images
识别、定位、关联:从文档图像中进行端到端键值提取
机构 * IBM Research Zurich(IBM苏黎世研究院) ; ETH Zurich(苏黎世联邦理工学院)
AI总结 该研究针对传统文档处理的误差传播问题,微调SmolDocling模型实现端到端键值提取,在多个数据集上性能优于更大基线模型,且体积小、推理快。
Comments Accepted at ICDAR 2026. 17 pages, 6 figures, 7 tables