arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

大厂专区

Baidu(百度)

2026-04-06 至 2026-04-06 共收录 2
2603.24326 2026-04-06 cs.CV cs.AI cs.IR

Boosting Document Parsing Efficiency and Performance with Coarse-to-Fine Visual Processing

通过粗到细的视觉处理提升文档解析效率和性能

Cheng Cui, Ting Sun, Suyin Liang, Tingquan Gao, Zelun Zhang, Jiaxuan Liu, Xueqing Wang, Changda Zhou, Hongen Liu, Manhui Lin, Yue Zhang, Yubo Zhang, Jing Zhang, Jun Zhang, Xing Wei, Yi Liu, Dianhai Yu, Yanjun Ma

机构 * PaddlePaddle Team, Baidu Inc.(百度公司飞桨团队) Xi’an Jiaotong University(西安交通大学)

AI总结 本文提出PaddleOCR-VL模型,通过粗到细的视觉处理方法,减少冗余视觉区域,提升文档解析和识别的效率与性能,实验表明其在页面级和元素级识别上均达到最优。

Comments Accepted by CVPR2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.21957 2026-04-06 cs.CV

PaddleOCR-VL-1.5: Towards a Multi-Task 0.9B VLM for Robust In-the-Wild Document Parsing

PaddleOCR-VL-1.5:迈向一个鲁棒的多任务0.9B视觉语言模型用于野外文档解析

Cheng Cui, Ting Sun, Suyin Liang, Tingquan Gao, Zelun Zhang, Jiaxuan Liu, Xueqing Wang, Changda Zhou, Hongen Liu, Manhui Lin, Yue Zhang, Yubo Zhang, Yi Liu, Dianhai Yu, Yanjun Ma

机构 * PaddlePaddle Team, Baidu Inc.(百度公司PaddlePaddle团队)

AI总结 PaddleOCR-VL-1.5通过引入Real5-OmniDocBench基准测试,在文档解析任务中达到94.5%的SOTA准确率,并扩展了密封识别和文本定位任务,同时保持0.9B超紧凑模型的高效性。

详情

展开后加载摘要…

URL PDF HTML 收藏