DocSLM: A Small Vision-Language Model for Long Multimodal Document Understanding
DocSLM:一种用于长多模态文档理解的小型视觉-语言模型
机构 * Microsoft(微软公司) ; LMU Munich(慕尼黑大学) ; MCML ; FAIR Meta(Meta FAIR) ; UNC Chapel Hill(北卡罗来纳大学教堂山分校)
专题命中 文档图表理解 :vision-language model(title,abstract);分类 cs.CV
AI总结 DocSLM通过高效的小型视觉-语言模型,在受限内存下实现长多模态文档理解,使用更少的资源达到与先进方法相当的性能。