MeDocVL: A Visual Language Model for Medical Document Understanding and Parsing
MeDocVL:一种用于医疗文档理解与解析的视觉语言模型
机构 * Visual Computing Group (VCG)(视觉计算组)
专题命中 文档图表理解 :visual language model(title);vision-language model(abstract);VLM(abstract);分类 cs.CV
AI总结 MeDocVL通过训练驱动的标签细化和噪声意识的混合后训练策略,实现了对医疗文档的高精度解析,优于现有OCR和VLM方法。
Comments 20 pages, 8 figures. Technical report