arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

视觉大模型 / VLM

视觉语言模型、视觉推理、视觉问答、图文理解和视觉 grounding。

2025-12-01 至 2025-12-01 共收录 2 信号源:cs.CV, cs.AI, cs.LG

1. 文档图表理解 2 篇

2511.22448 2025-12-01 cs.AI cs.IR 79%

Structured Extraction from Business Process Diagrams Using Vision-Language Models

使用视觉-语言模型从业务流程图中提取结构

Pritam Deka, Barry Devereux

机构 * Queen's University Belfast(女王大学贝尔法斯特)

专题命中 文档图表理解 :vision-language model(title,abstract);分类 cs.AI

AI总结 本文提出使用视觉-语言模型和OCR技术从BPMN图像中提取结构化数据,无需源文件或文本注释。

Comments To appear in the Proceedings of the 2026 ACM Symposium on Applied Computing (SAC '26)

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.22850 2025-12-01 cs.CV 70%

Resolving Evidence Sparsity: Agentic Context Engineering for Long-Document Understanding

解决证据稀疏性:面向长文档理解的代理情境工程

Keliang Liu, Zizhi Chen, Mingcheng Li, Jingqun Tang, Dingkang Yang, Lihua Zhang

专题命中 文档图表理解 :vision language model(abstract);VLM(abstract);分类 cs.CV

AI总结 SLEUTH通过多代理框架解决长文档理解中的证据稀疏问题,提升多模态文档处理性能。

详情

展开后加载摘要…

URL PDF HTML 收藏