Rule-Based Reinforcement Learning for Document Image Classification with Vision Language Models
基于规则的强化学习用于文档图像分类与视觉语言模型
机构 * University of Applied Sciences and Arts Western Switzerland(西瑞士应用艺术大学) ; University of Fribourg(弗里堡大学)
专题命中 文档图表理解 :vision language model(title);分类 cs.CV
AI总结 本文提出基于规则的强化学习方法,用于提升文档图像分类任务的泛化能力,通过不同场景验证其在处理超出分布数据时的优势。
Comments Code available at https://github.com/jungomi/vision-finetune
Journal ref Document Analysis and Recognition - ICDAR 2025 Workshops. pp. 292-309. Cham: Springer Nature Switzerland