Semantic Document Derendering: SVG Reconstruction via Vision-Language Modeling
专题命中 文档图表理解 :vision-language model(title,abstract);VLM(abstract);分类 cs.CV、cs.AI、cs.LG
AI 大模型
视觉语言模型、视觉推理、视觉问答、图文理解和视觉 grounding。
专题命中 文档图表理解 :vision-language model(title,abstract);VLM(abstract);分类 cs.CV、cs.AI、cs.LG
机构 * Korea University(韩国大学)
专题命中 文档图表理解 :multimodal large language model(abstract);MLLM(abstract);分类 cs.CV
Comments AAAI 2026 (Main Technical Track)
机构 * CVIT, Kohli Centre for Intelligent Systems, IIIT Hyderabad(IIIT海得拉尔计算机视觉研究所、Kohli智能系统中心) ; Adobe Research, Bengaluru(Adobe研究)
专题命中 文档图表理解 :vision-language model(abstract);分类 cs.CV
Comments 25 pages, 21 figures