arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

视觉大模型 / VLM

视觉语言模型、视觉推理、视觉问答、图文理解和视觉 grounding。

2025-11-26 至 2025-11-26 共收录 2 信号源:cs.CV, cs.AI, cs.LG

1. 文档图表理解 2 篇

2510.14528 2025-11-26 cs.CV 83%

PaddleOCR-VL: Boosting Multilingual Document Parsing via a 0.9B Ultra-Compact Vision-Language Model

PaddleOCR-VL: 通过0.9B超紧凑视觉-语言模型提升多语言文档解析

Cheng Cui, Ting Sun, Suyin Liang, Tingquan Gao, Zelun Zhang, Jiaxuan Liu, Xueqing Wang, Changda Zhou, Hongen Liu, Manhui Lin, Yue Zhang, Yubo Zhang, Handong Zheng, Jing Zhang, Jun Zhang, Yi Liu, Dianhai Yu, Yanjun Ma

机构 * PaddlePaddle Team, Baidu Inc.(百度公司)

专题命中 文档图表理解 :vision-language model(title,abstract);VLM(abstract);分类 cs.CV

AI总结 PaddleOCR-VL通过0.9B超紧凑视觉-语言模型实现多语言文档解析的高效准确识别

Comments Github Repo: https://github.com/PaddlePaddle/PaddleOCR

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.19806 2025-11-26 cs.CV 79%

Reading Between the Lines: Abstaining from VLM-Generated OCR Errors via Latent Representation Probes

在行之间阅读:通过潜在表示探测避免VLM生成的OCR错误

Jihan Yao, Achin Kulshrestha, Nathalie Rauschmayr, Reed Roberts, Banghua Zhu, Yulia Tsvetkov, Federico Tombari

机构 * University of Washington(华盛顿大学) Google(谷歌)

专题命中 文档图表理解 :VLM(title);visual question answering(abstract);分类 cs.CV

AI总结 本文提出通过潜在表示探测提升VLM在OCR任务中的回避准确性,通过内部状态检测置信度信号,提高系统可靠性。

详情

展开后加载摘要…

URL PDF HTML 收藏