arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

视觉大模型 / VLM

视觉语言模型、视觉推理、视觉问答、图文理解和视觉 grounding。

2025-10-22 至 2025-10-22 共收录 2 信号源:cs.CV, cs.AI, cs.LG

1. 文档图表理解 2 篇

2506.03197 2025-10-22 cs.CV cs.AI cs.CL cs.LG 67%

Infinity Parser: Layout Aware Reinforcement Learning for Scanned Document Parsing

Baode Wang, Biao Wu, Weizhen Li, Meng Fang, Zuming Huang, Jun Huang, Haozhe Wang, Yanjie Liang, Ling Chen, Wei Chu, Yuan Qi

机构 * INFLY Tech(INFLY科技) Australian Artificial Intelligence Institute(澳大利亚人工智能研究所) University of Liverpool(利物浦大学)

专题命中 文档图表理解 :vision-language model(abstract);分类 cs.CV、cs.AI、cs.LG

Comments 16 pages, 12 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.18703 2025-10-22 cs.CV 57%

Exploring a Unified Vision-Centric Contrastive Alternatives on Multi-Modal Web Documents

Yiqi Lin, Alex Jinpeng Wang, Linjie Li, Zhengyuan Yang, Mike Zheng Shou

机构 * Show Lab, National University of Singapore(新加坡国立大学展示实验室) Central South University(中南大学) Microsoft(微软公司)

专题命中 文档图表理解 :vision-language model(abstract);分类 cs.CV

Comments Project page: this https://linyq17.github.io/VC2L/

详情

展开后加载摘要…

URL PDF HTML 收藏