Zero-Shot Document Understanding using Pseudo Table of Contents-Guided Retrieval-Augmented Generation
专题命中 文档图表理解 :multimodal large language model(abstract);分类 cs.AI、cs.LG
AI 大模型
视觉语言模型、视觉推理、视觉问答、图文理解和视觉 grounding。
专题命中 文档图表理解 :multimodal large language model(abstract);分类 cs.AI、cs.LG
机构 * Harvard University(哈佛大学) ; Google Research(谷歌研究)
专题命中 文档图表理解 :vision-language model(abstract);分类 cs.AI、cs.LG
Comments 5 pages, 6 figures
机构 * UBC(不列颠哥伦比亚大学) ; Microsoft(微软) ; Vector Institute for AI(人工智能向量研究所) ; CIFAR AI Chair(卡尔·弗雷德里克人工智能主席)
专题命中 文档图表理解 :vision language model(abstract);分类 cs.CV、cs.AI
Comments arXiv admin note: substantial text overlap with arXiv:2407.14506
专题命中 文档图表理解 :vision-language model(abstract);分类 cs.CV、cs.AI
机构 * PaddlePaddle Team, Baidu Inc.(百度公司)
专题命中 文档图表理解 :multimodal large language model(abstract);分类 cs.CV、cs.AI
专题命中 文档图表理解 :VLM(abstract);分类 cs.CV、cs.AI
Comments Code and qualitative examples are available at: https://psrdataset.github.io
机构 * Los Alamos National Laboratory(洛斯阿拉莫斯国家实验室) ; Gianforte School of Computing(吉安福特计算学院) ; Montana State University Bozeman(蒙大拿州立大学博兹曼分校)
专题命中 文档图表理解 :grounding(abstract);分类 cs.CV、cs.AI
机构 * NVIDIA(英伟达)
专题命中 文档图表理解 :LLaVA(abstract);分类 cs.CV、cs.AI
机构 * Georgia Institute of Technology(佐治亚理工学院) ; University of Texas at Austin(德克萨斯大学奥斯汀分校)
专题命中 文档图表理解 :grounding(abstract);分类 cs.CV、cs.AI
Comments 15 pages, 4 figures, AIED 2025
专题命中 文档图表理解 :vision-language model(abstract);分类 cs.CV、cs.LG
专题命中 文档图表理解 :vision-language model(abstract);分类 cs.CV、cs.AI
Comments Accepted by CVPR2025
专题命中 文档图表理解 :multimodal large language model(abstract);分类 cs.CV、cs.AI
专题命中 文档图表理解 :multimodal large language model(abstract);分类 cs.CV、cs.AI
Comments WWW'25
专题命中 文档图表理解 :vision-language model(abstract);分类 cs.CV、cs.AI
Comments 8 pages, 7 figures
专题命中 文档图表理解 :visual question answering(abstract);分类 cs.CV、cs.AI
Comments Project webpage: https://m3docrag.github.io
专题命中 文档图表理解 :visual language model(abstract);分类 cs.AI、cs.LG
专题命中 文档图表理解 :multimodal large language model(abstract);分类 cs.CV、cs.AI
专题命中 文档图表理解 :multimodal large language model(abstract);分类 cs.CV、cs.AI
Comments CVPR 2024
专题命中 文档图表理解 :grounding(abstract);分类 cs.CV、cs.AI
专题命中 文档图表理解 :visual question answering(abstract);分类 cs.CV、cs.AI
专题命中 文档图表理解 :visual question answering(abstract);分类 cs.CV、cs.LG
专题命中 文档图表理解 :VLM(abstract);分类 cs.CV、cs.LG
Comments 18 pages, accepted as a reproducibility paper at ECIR 2023
专题命中 文档图表理解 :visual question answering(abstract);分类 cs.CV、cs.AI
Comments ACM MM 2022
专题命中 文档图表理解 :vision-language model(abstract);分类 cs.CV、cs.AI
专题命中 文档图表理解 :visual question answering(abstract);分类 cs.CV、cs.AI
专题命中 文档图表理解 :grounding(abstract);分类 cs.AI、cs.LG
Comments Accepted to Findings of EMNLP 2022
专题命中 文档图表理解 :grounding(abstract);分类 cs.AI、cs.LG
Comments Accepted by 1st DialDoc Workshop at ACL-IJCNLP 2021
DocClaw:用于智能文档处理的统一智能体系统
专题命中 文档图表理解 :VLM(abstract_cn);分类 cs.CV
AI总结 研究针对现有智能文档处理任务多为独立建模的问题,提出统一智能体系统DocClaw,通过智能体与文档的共享交互处理多种IDP任务,在基准测试中取得有竞争力的性能。
代码作为表示:学术文档的可编译解析范式
机构 * Southeast University(东南大学) ; Nanyang Technological University(南洋理工大学) ; Nanjing University(南京大学)
专题命中 文档图表理解 :multimodal large language model(abstract);分类 cs.CV
AI总结 针对学术PDF难以被机器处理的问题,提出CADP可编译解析范式,构建CADP-Bench基准并测试SOTA MLLMs,发现前沿模型仍难生成高保真可执行重构,该基准已开放供研究。
Comments Accepted by ACM MM 2026
ConceptFormer:学习自适应潜在概念以实现视觉文档检索中的查询-文档对齐
机构 * Northeastern University(东北大学) ; Tsinghua University(清华大学) ; Peking University(北京大学)
专题命中 文档图表理解 :vision-language model(abstract);分类 cs.CV
AI总结 针对视觉文档检索中现有监督信号的局限,本文提出ConceptFormer框架,以自适应潜在概念为中间表示衔接语义鸿沟,在基准测试中较最强基线实现了16.7%、22.1%的NDCG@10相对提升,性能优异。