Baseer: A Vision-Language Model for Arabic Document-to-Markdown OCR
专题命中 文档图表理解 :vision-language model(title,abstract);multimodal large language model(abstract);MLLM(abstract);分类 cs.CV
AI 大模型
视觉语言模型、视觉推理、视觉问答、图文理解和视觉 grounding。
专题命中 文档图表理解 :vision-language model(title,abstract);multimodal large language model(abstract);MLLM(abstract);分类 cs.CV
机构 * Indian Institute of Technology Patna(印度帕纳杰大学) ; CRISIL LTD(CRISIL公司)
专题命中 文档图表理解 :vision-language model(abstract);分类 cs.CV、cs.AI
机构 * The Hong Kong University of Science and Technology(香港理工大学)
专题命中 文档图表理解 :vision-language model(abstract);分类 cs.CV
Comments EMNLP 2025: Camera-ready version