arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

视觉大模型 / VLM

视觉语言模型、视觉推理、视觉问答、图文理解和视觉 grounding。

共收录 665 信号源:cs.CV, cs.AI, cs.LG

1. 文档图表理解 665 篇

2306.17107 2024-02-06 cs.CV cs.CL 57%

LLaVAR: Enhanced Visual Instruction Tuning for Text-Rich Image Understanding

Yanzhe Zhang, Ruiyi Zhang, Jiuxiang Gu, Yufan Zhou, Nedim Lipka, Diyi Yang, Tong Sun

专题命中 文档图表理解 :LLaVA(abstract);分类 cs.CV

Comments Preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2312.10188 2023-12-19 cs.LG 57%

WordScape: a Pipeline to extract multilingual, visually rich Documents with Layout Annotations from Web Crawl Data

Maurice Weber, Carlo Siebenschuh, Rory Butler, Anton Alexandrov, Valdemar Thanner, Georgios Tsolakis, Haris Jabbar, Ian Foster, Bo Li, Rick Stevens, Ce Zhang

专题命中 文档图表理解 :visual question answering(abstract);分类 cs.LG

Comments NeurIPS 2023 Datasets and Benchmarks

详情

展开后加载摘要…

URL PDF HTML 收藏
2305.15808 2023-05-26 cs.CV 57%

Towards Language-guided Interactive 3D Generation: LLMs as Layout Interpreter with Generative Feedback

Yiqi Lin, Hao Wu, Ruichen Wang, Haonan Lu, Xiaodong Lin, Hui Xiong, Lin Wang

专题命中 文档图表理解 :LLaVA(abstract);分类 cs.CV

Comments Preprint. Work in Progres

详情

展开后加载摘要…

URL PDF HTML 收藏
2210.02223 2022-10-06 cs.CL cs.AI 57%

CorefDiffs: Co-referential and Differential Knowledge Flow in Document Grounded Conversations

Lin Xu, Qixian Zhou, Jinlan Fu, Min-Yen Kan, See-Kiong Ng

专题命中 文档图表理解 :grounding(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2207.13979 2022-08-01 cs.CL cs.AI 57%

Knowing Where and What: Unified Word Block Pretraining for Document Understanding

Song Tao, Zijian Wang, Tiantian Fan, Canjie Luo, Can Huang

专题命中 文档图表理解 :MLLM(abstract);分类 cs.AI

Comments incomplete experiments

详情

展开后加载摘要…

URL PDF HTML 收藏
2204.08387 2022-07-20 cs.CL cs.CV 57%

LayoutLMv3: Pre-training for Document AI with Unified Text and Image Masking

Yupan Huang, Tengchao Lv, Lei Cui, Yutong Lu, Furu Wei

专题命中 文档图表理解 :visual question answering(abstract);分类 cs.CV

Comments ACM Multimedia 2022

详情

展开后加载摘要…

URL PDF HTML 收藏
2204.07770 2022-04-19 cs.CL cs.AI 57%

UniGDD: A Unified Generative Framework for Goal-Oriented Document-Grounded Dialogue

Chang Gao, Wenxuan Zhang, Wai Lam

专题命中 文档图表理解 :grounding(abstract);分类 cs.AI

Comments ACL 2022

详情

展开后加载摘要…

URL PDF HTML 收藏
2108.02923 2021-11-09 cs.CV cs.CL 57%

StrucTexT: Structured Text Understanding with Multi-Modal Transformers

Yulin Li, Yuxi Qian, Yuchen Yu, Xiameng Qin, Chengquan Zhang, Yan Liu, Kun Yao, Junyu Han, Jingtuo Liu, Errui Ding

专题命中 文档图表理解 :visual language model(abstract);分类 cs.CV

Comments ACM Multimedia 2021. 9 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2110.00711 2021-10-05 cs.CV 57%

Asking questions on handwritten document collections

Minesh Mathew, Lluis Gomez, Dimosthenis Karatzas, CV Jawahar

专题命中 文档图表理解 :visual question answering(abstract);分类 cs.CV

Comments pre-print version

Journal ref journal = {Int. J. Document Anal. Recognit.}, volume = {24}, number = {3}, pages = {235--249}, year = {2021}

详情

展开后加载摘要…

URL PDF HTML 收藏
2101.11272 2021-05-11 cs.CL cs.CV 57%

VisualMRC: Machine Reading Comprehension on Document Images

Ryota Tanaka, Kyosuke Nishida, Sen Yoshida

专题命中 文档图表理解 :visual question answering(abstract);分类 cs.CV

Comments Accepted as a full paper at AAAI 2021. The first two authors have equal contribution

详情

展开后加载摘要…

URL PDF HTML 收藏
2104.08405 2021-04-20 cs.CL cs.CV cs.IR 57%

LAMPRET: Layout-Aware Multimodal PreTraining for Document Understanding

Te-Lin Wu, Cheng Li, Mingyang Zhang, Tao Chen, Spurthi Amba Hombaiah, Michael Bendersky

专题命中 文档图表理解 :grounding(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2007.00398 2021-01-06 cs.CV cs.IR 57%

DocVQA: A Dataset for VQA on Document Images

Minesh Mathew, Dimosthenis Karatzas, C. V. Jawahar

专题命中 文档图表理解 :visual question answering(abstract);分类 cs.CV

Comments accepted at WACV 2021

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.11644 2026-08-14 cs.DB 版本更新 50%

Guided Table Retrieval for Structured Data Search

面向结构化数据搜索的引导式表格检索

Alekh Jindal, Jyoti Pandey, Christina Pavlopoulou, Ronith PR, Sharath Prakash, Shi Qiao, Shivani Tripathi, Wangda Zhang

专题命中 文档图表理解 :grounding(abstract)

AI总结 该研究针对结构化数据库自然语言问答任务,提出四阶段引导式表格检索流程,在BIRD-DEV和BEAVER基准上取得优于基线的准确率与F1值,生成的精确连接树可直接供下游查询编译器使用。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.05087 2026-08-06 cs.CL cs.IR 版本更新 50%

Document Optimization for Black-Box Retrieval via Reinforcement Learning

基于强化学习的黑盒检索文档优化

Omri Uzan, Ron Polonsky, Douwe Kiela, Christopher Potts

机构 * Stanford University(斯坦福大学) ContextualAI

专题命中 文档图表理解 :vision language model(abstract)

AI总结 提出通过强化学习(GRPO)优化文档表示,使其与目标检索器的查询分布对齐,仅需黑盒访问检索排名,在代码和视觉文档检索任务中提升性能,使小模型超越大模型。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.28853 2026-08-03 cs.HC 新提交 50%

Spatial Visual Analytics for Multi-Document Summary Verification

面向多文档摘要验证的空间视觉分析技术

Jiahao Xu, Wei Liu, Yang Liu, Eric Krokos, Kirsten Whitley, Xuan Wang, Rebecca Faust, Chris North

专题命中 文档图表理解 :grounding(abstract)

AI总结 该研究针对多文档摘要验证难题,提出SVS视觉分析系统,含两种二维布局,实验表明其可提升验证准确性、降低工作量,SUMMARY-GUIDED布局综合表现最优。

Comments Accepted to IEEE VIS 2026; 13 pages, including appendices (11-page paper plus 2-page appendices)

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.16134 2026-08-03 cs.DB 版本更新 50%

Benchmarking Table Extraction from Heterogeneous Scientific PDF Documents

对异构科学提取文档中表格提取的基准测试

Marijan Soric, Cécile Gracianne, Ioana Manolescu, Pierre Senellart

专题命中 文档图表理解 :vision language model(abstract)

AI总结 本文提出了一种新的基准测试,用于评估端到端表格提取方法,通过分析评估指标和设计严谨的评估流程,揭示了当前方法在异构数据下的局限性。

Comments Extended version, with appendices, of a paper published at KDD '26

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.17122 2026-07-21 cs.CL 新提交 50%

Scope3Trace: Evidence-Based Identification and Extraction of Scope 3 GHG Emissions from Sustainability Reports

Scope3Trace:基于证据的可持续发展报告中范围三温室气体排放识别与提取

Siyuan Zheng, Yifan Duan, Chao Xue, Flora D. Salim

机构 * UNSW Sydney(新南威尔士大学悉尼分校)

专题命中 文档图表理解 :grounding(abstract)

AI总结 研究针对范围三温室气体排放分析难题,提出Scope3Trace框架,集成多种技术从ESG和可持续发展报告中提取相关信息,并构建多模态数据集,实现了异构可持续发展披露信息可靠提取与透明整合,且提取精度高。

Comments 23 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.24895 2026-06-25 cs.DL 新提交 50%

Hybrid Metadata Extraction from League of Nations Index Cards: From Feasibility Study to Archival System Integration

国联索引卡片的混合元数据提取:从可行性研究到档案系统集成

Florian Cafiero, Grégoire Mallard

专题命中 文档图表理解 :vision-language model(abstract)

AI总结 提出混合AI工作流从国联索引卡片中提取并整合档案元数据,结合YOLO、TrOCR、本地LLM后校正及微调视觉语言模型,实现从布局感知管道到混合架构的演进。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.26615 2026-06-08 cs.CL 版本更新 50%

SlideAgent: Hierarchical Agentic Framework for Multi-Page Visual Document Understanding

SlideAgent:用于多页视觉文档理解的分层代理框架

Yiqiao Jin, Rachneet Kaur, Zhen Zeng, Sumitra Ganesh, Srijan Kumar

机构 * Georgia Institute of Technology(佐治亚理工学院) J.P. Morgan AI Research(摩根大通AI研究)

专题命中 文档图表理解 :multimodal large language model(abstract)

AI总结 提出SlideAgent,一种用于多模态多页文档(如幻灯片)理解的分层代理框架,通过全局、页面和元素三级推理构建结构化表示,在专有和开源模型上分别提升7.9%和9.8%的准确率。

Comments ACL 2026 Main Conference. https://slideagent.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.29476 2026-05-29 cs.CL 50%

Comparative Evaluation of Machine Translation Systems on Images with Text

含文本图像的机器翻译系统比较评估

Blai Puchol, Sergio Gómez González, Miguel Domingo, Francisco Casacuberta

机构 * ValgrAI - Valencian Graduate School and Research Network for Artificial Intelligence(ValgrAI - 瓦伦西亚人工智能研究生学院和研究网络)

专题命中 文档图表理解 :MLLM(abstract_cn)

AI总结 本研究比较评估了三种机器翻译范式(模块化流水线、多模态大语言模型和端到端模型Translatotron-V)在含文本图像翻译任务上的性能,发现多模态大语言模型表现最佳。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.25781 2026-05-26 cs.CL 50%

Double Triangle Annotation: A Scalable Human-in-the-Loop Framework for High-Precision Historical Document Annotation

双三角形标注:一种可扩展的人机协同高精度历史文档标注框架

Yi Ren

机构 * École Polytechnique Fédérale de Lausanne(洛桑联邦理工学院)

专题命中 文档图表理解 :multimodal large language model(abstract)

AI总结 提出双三角形标注框架,通过两层人机协同和跨模型共识自动完成大部分标注工作,实现高精度历史文档结构化信息提取。

Comments 12 pages, 4 figures. ACL ARR 2026 March submission

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.15794 2026-05-18 cs.CL 50%

ForMaT: Dataset for Visually-Grounded Multilingual PDF Translation

ForMaT:用于视觉接地多语言PDF翻译的数据集

Michał Ciesiółka, Dawid Wiśniewski, Adrian Charkiewicz, Kamil Guttmann

机构 * Laniqo Faculty of Mathematics and Computer Science, Adam Mickiewicz University(亚当·密茨凯维奇大学数学与计算机科学学院) Poznań University of Technology(波兹南技术大学)

专题命中 文档图表理解 :grounding(abstract)

AI总结 ForMaT通过3956个PDF构建多语言翻译数据集,保留布局元数据以提升多模态翻译效果,采用K-Medoids采样捕捉复杂元素,揭示当前MT系统在空间接地与几何同步上的不足,为布局感知翻译模型提供基准。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.23477 2026-05-15 cs.CL 50%

MMTutorBench: The First Multimodal Benchmark for AI Math Tutoring

MMTutorBench:首个多模态AI数学辅导基准

Tengchao Yang, Sichen Guo, Mengzhao Jia, Jiaming Su, Yuanyang Liu, Zhihan Zhang, Meng Jiang

机构 * Tongji University(同济大学) Fudan University(复旦大学) University of Notre Dame(圣母大学) Nanjing University of Posts and Telecommunications(南京邮电大学)

专题命中 文档图表理解 :multimodal large language model(abstract)

AI总结 MMTutorBench首次提出多模态AI数学辅导基准,包含685个围绕教学关键步骤构建的问题,通过六维度细粒度评估和三个任务(洞察发现、操作构建、操作执行)评估12个顶级MLLMs,揭示了专有与开源系统间的性能差异及OCR、少样本提示等对辅导质量的影响。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.10855 2026-05-12 cs.CL 50%

Learning More from Less: Exploiting Counterfactuals for Data-Efficient Chart Understanding

从少量数据中学习更多:利用反事实以提高图表理解的数据效率

Jianzhu Bao, Haozhen Zhang, Kuicai Dong, Bozhi Wu, Sarthak Ketanbhai Modi, Zi Pong Lim, Yon Shin Teo, Wenya Wang

机构 * Nanyang Technological University(南洋理工大学) Aumovio Singapore Pte. Ltd.(Aumovio新加坡私人有限公司)

专题命中 文档图表理解 :vision-language model(abstract)

AI总结 本文提出ChartCF框架,通过反事实数据合成和多模态偏好优化,提升图表理解的反事实敏感性,实验表明其在少数据下表现优异。

Comments Accepted to ACL 2026 Main Conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.22051 2026-04-28 cs.HC 50%

DataSway: Vivifying Metaphoric Visualization with Animation Clip Generation and Coordination

DataSway: 通过动画片段生成与协调使隐喻可视化生动化

Liwenhan Xie, Jiayi Zhou, Anyi Rao, Huamin Qu, Xinhuan Shu

专题命中 文档图表理解 :vision-language model(abstract)

AI总结 本文提出DataSway系统,通过动画片段生成与协调技术,帮助用户创建基于SVG的隐喻可视化动画,提升数据抽象编码的理解与交互体验。

Comments Accepted to DIS'26: ACM Designing Interactive Systems. Website: https://shellywhen.github.io/projects/DataSway

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.17325 2026-04-21 cs.CL 50%

Align Documents to Questions: Question-Oriented Document Rewriting for Retrieval-Augmented Generation

对齐文档与问题:面向问题的文档重写以增强检索增强生成

Jiaang Li, Zhendong Mao, Quan Wang, Yuning Wan, Yongdong Zhang

机构 * University of Science and Technology of China(中国科学技术大学) Beijing University of Posts and Telecommunications(北京邮电大学)

专题命中 文档图表理解 :grounding(abstract)

AI总结 本文提出QREAM框架,通过风格控制重写使检索文档更符合问题需求,提升检索增强生成的准确性与效率。

Comments ACL'26 Findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.13468 2026-04-21 cs.IR cs.CL 50%

From Relevance to Authority: Authority-aware Generative Retrieval in Web Search Engines

从相关性到权威性:面向网页搜索引擎的权威感知生成检索

Sunkyung Lee, Jihye Back, Donghyeon Jeon, Soonhwan Kwon, Moonkwon Kim, Inho Kang, Jongwuk Lee

机构 * Sungkyunkwan University(成均馆大学) Naver Corporation(Naver公司)

专题命中 文档图表理解 :vision-language model(abstract)

AI总结 本文提出权威感知生成检索框架AuthGR,通过多模态权威评分、三阶段训练和混合集成流程提升检索的权威性和准确性,在实际应用中显著提高用户参与度和可靠性。

Comments ACL 2026 (Industry Track)

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.05038 2026-04-08 cs.CL 50%

Guided Query Refinement: Multimodal Hybrid Retrieval with Test-Time Optimization

引导查询细化:多模态混合检索与测试时优化

Omri Uzan, Asaf Yehudai, Roi pony, Eyal Shnarch, Ariel Gera

机构 * Stanford University(斯坦福大学) IBM Research(IBM研究院) The Hebrew University of Jerusalem(耶路撒冷希伯来大学)

专题命中 文档图表理解 :vision-language model(abstract)

AI总结 本文提出引导查询细化方法,通过测试时优化提升多模态检索性能,使视觉中心模型在效率和性能上达到更优平衡。

Comments ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.03992 2026-04-02 cs.IR 50%

Nemotron ColEmbed V2: Top-Performing Late Interaction Embedding Models for Visual Document Retrieval

Nemotron ColEmbed V2:视觉文档检索中表现优异的后期交互嵌入模型

Gabriel de Souza P. Moreira, Ronay Ak, Mengyao Xu, Oliver Holworthy, Benedikt Schifferer, Zhiding Yu, Yauhen Babakhin, Radek Osmulski, Jiarui Cai, Ryan Chesler, Bo Liu, Even Oldridge

专题命中 文档图表理解 :VLM(abstract)

AI总结 本文提出Nemotron ColEmbed V2模型,通过集群采样、硬负样本挖掘等技术,在ViDoRe基准上实现最佳性能,展示了低维嵌入在准确率与存储间的平衡实验。

Comments Proceedings of the 1st Late Interaction Workshop (LIR) @ ECIR 2026, April 02, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.25804 2026-03-30 cs.CL 50%

RealChart2Code: Advancing Chart-to-Code Generation with Real Data and Multi-Task Evaluation

RealChart2Code:通过真实数据和多任务评估推进图表到代码生成

Jiajun Zhang, Yuying Li, Zhixun Li, Xingyu Guo, Jingzhuo Wu, Leqi Zheng, Yiran Yang, Jianke Zhang, Qingbin Li, Shannan Yan, Zhetong Li, Changguo Jia, Junfei Wu, Zilei Wang, Qiang Liu, Liang Wang

机构 * USTC(中国科学技术大学) THU(清华大学) CUHK(香港中文大学) UCAS(中国科学院大学) CASIA(中国科学院自动化研究所) BNU(北京师范大学) BUPT(北京邮电大学) BIT(北京理工大学) PKU(北京大学)

专题命中 文档图表理解 :vision-language model(abstract)

AI总结 本文提出RealChart2Code基准,通过真实数据和多任务评估,评估VLMs在复杂图表生成中的性能,揭示其在多面板图表上的局限性。

详情

展开后加载摘要…

URL PDF HTML 收藏