Enhancing Document VQA Models via Retrieval-Augmented Generation
机构 * Computer Vision Center, Universitat Autònoma de Barcelona, Spain(巴塞罗那自治大学计算机视觉中心)
专题命中 文档图表理解 :vision-language model(abstract);visual question answering(abstract);分类 cs.CV
Comments Accepted at Workshop on Machine Learning in Document Analysis and Recognition (ICDAR WML 2025), Wuhan, China