When Do VLMs Help Arabic Manuscript OCR? A Cross-Dataset Study
视觉语言模型(VLMs)何时助力阿拉伯手稿光学字符识别(OCR)?一项跨数据集研究
机构 * Qatar Computing Research Institute(卡塔尔计算研究所) ; Hamad Bin Khalifa University(哈马德·本·哈利法大学) ; Northwestern University in Qatar(卡塔尔西北大学) ; University of Doha for Science Technology(多哈科技大学)
专题命中 文档图表理解 :VLM(summary_cn,abstract);vision-language model(abstract);分类 cs.CV
AI总结 本文通过跨8类阿拉伯语文本数据集的实验,探究VLMs对阿拉伯手稿OCR的助力场景,提出OCR先验可恢复性原则,支持构建自适应OCR-VLM工作流。