arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

视觉大模型 / VLM

视觉语言模型、视觉推理、视觉问答、图文理解和视觉 grounding。

2026-02-09 至 2026-02-09 共收录 1 信号源:cs.CV, cs.AI, cs.LG

1. 文档图表理解 1 篇

2602.06402 2026-02-09 cs.CV 83%

MeDocVL: A Visual Language Model for Medical Document Understanding and Parsing

MeDocVL:一种用于医疗文档理解与解析的视觉语言模型

Wenjie Wang, Wei Wu, Ying Liu, Yuan Zhao, Xiaole Lv, Liang Diao, Zengjian Fan, Wenfeng Xie, Ziling Lin, De Shi, Lin Huang, Kaihe Xu, Hong Li

机构 * Visual Computing Group (VCG)(视觉计算组)

专题命中 文档图表理解 :visual language model(title);vision-language model(abstract);VLM(abstract);分类 cs.CV

AI总结 MeDocVL通过训练驱动的标签细化和噪声意识的混合后训练策略,实现了对医疗文档的高精度解析,优于现有OCR和VLM方法。

Comments 20 pages, 8 figures. Technical report

详情

展开后加载摘要…

URL PDF HTML 收藏