Multi-Modal Semantic Parsing for the Interpretation of Tombstone Inscriptions
机构 * University of Groningen(格罗宁根大学)
专题命中 文档图表理解 :vision-language model(abstract);分类 cs.CV
Comments ACMMM 2025
AI 大模型
视觉语言模型、视觉推理、视觉问答、图文理解和视觉 grounding。
机构 * University of Groningen(格罗宁根大学)
专题命中 文档图表理解 :vision-language model(abstract);分类 cs.CV
Comments ACMMM 2025
机构 * Amazon AGI(亚马逊人工智能研究院) ; University of Trento(特伦托大学)
专题命中 文档图表理解 :grounding(abstract)