dots.ocr: Multilingual Document Layout Parsing in a Single Vision-Language Model
dots.ocr: 一种单一视觉-语言模型中的多语言文档布局解析
机构 * hi lab(hi实验室) ; Xiaohongshu Inc(小红书公司)
专题命中 文档图表理解 :vision-language model(title,abstract);分类 cs.CV
AI总结 dots_ocr是一种单一视觉-语言模型,通过联合学习多语言文档布局解析的三个核心任务,实现了统一框架下的高效性能提升。