arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

视觉大模型 / VLM

视觉语言模型、视觉推理、视觉问答、图文理解和视觉 grounding。

2026-02-13 至 2026-02-13 共收录 3 信号源:cs.CV, cs.AI, cs.LG

1. 文档图表理解 3 篇

2602.11960 2026-02-13 cs.CV cs.CL cs.LG 84%

Benchmarking Vision-Language Models for French PDF-to-Markdown Conversion

对法语PDF到Markdown转换的视觉语言模型进行基准测试

Bruno Rigal, Victor Dupriez, Alexis Mignon, Ronan Le Hy, Nicolas Mery

机构 * Probayes, La Poste(Probayes公司) OpenValue, La Poste(OpenValue公司)

专题命中 文档图表理解 :vision-language model(title,abstract);grounding(abstract);分类 cs.CV、cs.LG

AI总结 本研究针对法语PDF到Markdown转换,评估了视觉语言模型在处理复杂文档中的表现,发现专有模型在手写和表单处理上更具鲁棒性,而开源系统在标准打印布局上表现良好。

Comments 13 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.21205 2026-02-13 cs.CV cs.CL 57%

TABLET: A Large-Scale Dataset for Robust Visual Table Understanding

TABLET:一个大规模数据集,用于鲁棒的视觉表格理解

Iñigo Alonso, Imanol Miranda, Eneko Agirre, Mirella Lapata

机构 * School of Informatics, University of Edinburgh(爱丁堡大学信息学院) HiTZ Center - Ixa, University of the Basque Country UPV/EHU(巴斯克国家大学HiTZ中心)

专题命中 文档图表理解 :vision-language model(abstract);分类 cs.CV

AI总结 TABLET是一个大规模视觉表格理解数据集,包含400万个示例和21项任务,旨在提升模型对真实世界表格可视化的鲁棒性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.11156 2026-02-13 cs.CL cs.AI cs.IR 57%

HybridRAG: A Practical LLM-based ChatBot Framework based on Pre-Generated Q&A over Raw Unstructured Documents

HybridRAG: 一种基于预生成问答的LLM聊天机器人框架

Sungmoon Kim, Hyuna Jeon, Dahye Kim, Mingyu Kim, Dong-Kyu Chae, Jiwoong Kim

机构 * Hanyang University(翰阳大学) Makebot Inc.(Makebot公司)

专题命中 文档图表理解 :grounding(abstract);分类 cs.AI

AI总结 HybridRAG通过预生成问答库和实时生成相结合,提升聊天机器人在处理无结构文档时的准确性和效率。

详情

展开后加载摘要…

URL PDF HTML 收藏