arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

视觉大模型 / VLM

视觉语言模型、视觉推理、视觉问答、图文理解和视觉 grounding。

共收录 665 信号源:cs.CV, cs.AI, cs.LG

1. 文档图表理解 665 篇

2509.16889 2026-03-27 cs.CL 50%

Can GRPO Boost Complex Multimodal Table Understanding?

GRPO能否提升复杂多模态表格理解?

Xiaoqiang Kang, Shengen Wu, Zimu Wang, Yilin Liu, Xiaobo Jin, Kaizhu Huang, Wei Wang, Yutao Yue, Xiaowei Huang, Qiufeng Wang

机构 * School of Advanced Technology, Xi’an Jiaotong-Liverpool University(西安交通大学利物浦大学先进科技学院) Department of Computer Science, University of Liverpool(利物浦大学计算机科学系) Information Hub, Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州)信息中心) University of Southern California(南加州大学) Duke Kunshan University(杜克大学昆山分校)

专题命中 文档图表理解 :LLaVA(abstract)

AI总结 本文提出Table-R1框架,通过预热、感知对齐GRPO和提示-完成GRPO三阶段提升多模态表格理解性能,优于SFT和GRPO。

Comments EMNLP 2025

Journal ref EMNLP 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.23508 2026-03-26 cs.CL cs.IR 50%

Fast and Faithful: Real-Time Verification for Long-Document Retrieval-Augmented Generation Systems

快速而忠实:长文档检索增强生成系统中的实时验证

Xunzhuo Liu, Bowei He, Xue Liu, Haichen Zhang, Huamin Chen

机构 * MBZUAI, McGill University(MBZUAI,麦吉尔大学)

专题命中 文档图表理解 :grounding(abstract)

AI总结 本文提出一种实时验证组件,用于长文档检索增强生成系统,通过平衡响应时间和验证覆盖度,提升对长文档的忠实性验证。

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.10891 2026-03-13 cs.HC 50%

(De)composing Craft: An Elementary Grammar for Sharing Expertise in Craft Workflows

(解)构工艺:一种用于在工艺流程中分享专业知识的初级语法

Ritik Batra, Lydia Kim, Ilan Mandel, Amritansh Kwatra, Jane L. E, Steven J. Jackson, Thijs Roumen

专题命中 文档图表理解 :MLLM(abstract)

AI总结 本文提出一种初级语法,用于记录工艺实践中的即兴行动,通过CraftLink界面分析视频并生成文档,促进知识共享与协作档案建设。

Comments 31 pages, 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.17315 2026-02-17 cs.CL 50%

HIPPO: Enhancing the Table Understanding Capability of LLMs through Hybrid-Modal Preference Optimization

HIPPO:通过混合模态偏好优化增强大语言模型的表格理解能力

Haolan Wang, Zhenghao Liu, Xinze Li, Xiaocui Yang, Yu Gu, Yukun Yan, Qi Shi, Fangfang Li, Chong Chen, Ge Yu

机构 * School of Computer Science and Engineering, Northeastern University, Shenyang, China(东北大学计算机科学与工程学院) Department of Computer Science and Technology, Tsinghua University, Beijing, China(清华大学计算机科学与技术系) Huawei Technologies Co., Ltd(华为技术有限公司)

专题命中 文档图表理解 :MLLM(abstract)

AI总结 HIPPO 通过混合模态偏好优化提升大语言模型的表格理解能力,实现 4% 的性能提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.13059 2026-02-16 cs.CL 50%

TraceBack: Multi-Agent Decomposition for Fine-Grained Table Attribution

TraceBack: 多智能体分解用于细粒度表格归因

Tejas Anvekar, Junha Park, Rajat Jha, Devanshu Gupta, Poojah Ganesan, Puneeth Mathur, Vivek Gupta

机构 * Arizona State University(亚利桑那州立大学) Adobe Research(Adobe研究院)

专题命中 文档图表理解 :grounding(abstract)

AI总结 TraceBack通过多智能体框架实现细粒度表格归因,提供可验证的单元格支持证据,提升问题回答的透明度和可解释性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.10271 2026-02-16 cs.IR cs.CL 50%

MLDocRAG: Multimodal Long-Context Document Retrieval Augmented Generation

MLDocRAG: 多模态长上下文文档检索增强生成

Yongyue Zhang, Yaxiong Wu

机构 * Independent Researcher(独立研究者)

专题命中 文档图表理解 :grounding(abstract)

AI总结 MLDocRAG通过构建多模态片段-查询图,实现多模态长上下文文档的检索增强生成,提升问答的准确性和连贯性。

Comments 15 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.19712 2026-01-28 cs.SD cs.MM 50%

Physics-Aware Novel-View Acoustic Synthesis with Vision-Language Priors and 3D Acoustic Environment Modeling

具有视觉-语言先验和3D声学环境建模的物理感知新视角声音合成

Congyi Fan, Jian Guan, Youtian Lin, Dongli Xu, Tong Ye, Qiaoxi Zhu, Pengming Feng, Wenwu Wang

机构 * Group of Intelligent Signal Processing(智能信号处理组) Harbin Engineering University(哈尔滨工程大学) School of Intelligence Science and Technology(智能科学与技术学院) Nanjing University(南京大学) Processing Speech and Images(语音与图像处理) KU Leuven(库尔勒文大学) Acoustics Lab(声学实验室) University of Technology Sydney(悉尼技术大学) State Key Laboratory of Space Information System and Integrated Application(空间信息系统与集成应用国家重点实验室) Centre for Vision Speech and Signal Processing(视觉语音与信号处理中心) University of Surrey(萨里大学)

专题命中 文档图表理解 :vision-language model(abstract)

AI总结 Phys-NVAS通过整合视觉-语言语义先验与3D声学环境建模,实现了具有物理感知的新视角声音合成,提升了声音的真实感和物理一致性。

Comments ICASSP 2026 Accept, Project page: https://physnvas.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.09554 2025-12-17 cs.IR 50%

Mixture-of-RAG: Integrating Text and Tables with Large Language Models

混合RAG:利用大语言模型整合文本和表格

Chi Zhang, Qiyang Chen, Mengqi Zhang

专题命中 文档图表理解 :grounding(abstract)

AI总结 MixRAG通过三阶段框架整合文本和表格,提升异构文档检索性能,实现混合模态文档接地的最新成果。

Comments Accepted to SIGKDD 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.04479 2025-12-05 cs.CL 50%

ThaiOCRBench: A Task-Diverse Benchmark for Vision-Language Understanding in Thai

ThaiOCRBench: 一种任务多样化的泰语视觉-语言理解基准

Surapon Nonesung, Teetouch Jaknamon, Sirinya Chaiophat, Natapong Nitarach, Chanakan Wittayasakpan, Warit Sirichotedumrong, Adisai Na-Thalang, Kunat Pipatanakul

机构 * SCB 10X R&D(SCB 10X研发部) SCB 10X SCBX Group(SCBX集团)

专题命中 文档图表理解 :vision-language model(abstract)

AI总结 ThaiOCRBench是一个针对泰语视觉-语言理解任务的多样化基准,通过人工标注的数据集评估了多种VLMs,揭示了专有模型在性能上的优势及开源模型在细粒度文本识别中的挑战。

Comments Accepted at IJCNLP-AACL 2025 (Main). This version includes the corrected Table 2 and an updated conclusion regarding the deletion count of the Gemma model

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.01341 2025-11-04 cs.CL 50%

AlignVLM: Bridging Vision and Language Latent Spaces for Multimodal Document Understanding

Ahmed Masry, Juan A. Rodriguez, Tianyu Zhang, Suyuchen Wang, Chao Wang, Aarash Feizi, Akshay Kalkunte Suresh, Abhay Puri, Xiangru Jian, Pierre-André Noël, Sathwik Tejaswi Madhusudhan, Marco Pedersoli, Bang Liu, Nicolas Chapados, Yoshua Bengio, Enamul Hoque, Christopher Pal, Issam H. Laradji, David Vazquez, Perouz Taslakian, Spandana Gella, Sai Rajeswar

机构 * ServiceNow York University(约克大学) Mila – Quebec AI Institute(魁北克人工智能研究院) École de Technologie Supérieure(魁北克高等技术学院) Université de Montréal(蒙特利尔大学) McGill University(麦吉尔大学) University of Waterloo(滑铁卢大学) CIFAR AI Chair(CIFAR人工智能 chair) Polytechnique Montréal(蒙特利尔理工学院) University of British Columbia(不列颠哥伦比亚大学)

专题命中 文档图表理解 :vision-language model(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.15349 2025-10-21 cs.CL 50%

Infinity Parser: Layout Aware Reinforcement Learning for Scanned Document Parsing

Baode Wang, Biao Wu, Weizhen Li, Meng Fang, Zuming Huang, Jun Huang, Haozhe Wang, Yanjie Liang, Ling Chen, Wei Chu, Yuan Qi

专题命中 文档图表理解 :vision-language model(abstract)

Comments This submission (arXiv:2510.15349) was mistakenly uploaded as a new article. It was intended to replace our previous work arXiv:2506.03197. All subsequent updates will be made to arXiv:2506.03197

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.19312 2025-10-20 cs.IR 50%

DocMMIR: A Framework for Document Multi-modal Information Retrieval

Zirui Li, Siwei Wu, Yizhi Li, Xingyu Wang, Yi Zhou, Chenghua Lin

专题命中 文档图表理解 :vision-language model(abstract)

Comments Accepted for publication at EMNLP 2025 Findings. Code and data publicly available at https://github.com/J1mL1/DocMMIR

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.23883 2025-09-30 cs.CL cs.IR 50%

DocPruner: A Storage-Efficient Framework for Multi-Vector Visual Document Retrieval via Adaptive Patch-Level Embedding Pruning

Yibo Yan, Guangwei Xu, Xin Zou, Shuliang Liu, James Kwok, Xuming Hu

机构 * Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州)) Alibaba Cloud Computing(阿里云计算)

专题命中 文档图表理解 :vision-language model(abstract)

Comments Under review

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.15432 2025-09-22 cs.IR 50%

SERVAL: Surprisingly Effective Zero-Shot Visual Document Retrieval Powered by Large Vision and Language Models

Thong Nguyen, Yibin Lei, Jia-Huei Ju, Andrew Yates

专题命中 文档图表理解 :vision-language model(abstract)

Comments Accepted

Journal ref EMNLP 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.07975 2025-08-12 cs.IR cs.CL 50%

Improving Document Retrieval Coherence for Semantically Equivalent Queries

Stefano Campese, Alessandro Moschitti, Ivano Lauriola

机构 * Amazon AGI(亚马逊人工智能研究院) University of Trento(特伦托大学)

专题命中 文档图表理解 :grounding(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.11935 2025-08-05 cs.CL 50%

ChartEdit: How Far Are MLLMs From Automating Chart Analysis? Evaluating MLLMs' Capability via Chart Editing

Xuanle Zhao, Xuexin Liu, Haoyue Yang, Xianzhen Luo, Fanhu Zeng, Jianling Li, Qi Shi, Chi Chen

机构 * Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所) Harbin Institute of Technology(哈尔滨工业大学) Tianjin University(天津大学) Tsinghua University(清华大学)

专题命中 文档图表理解 :multimodal large language model(abstract)

Comments Accepted by ACL2025 Findings, camera-ready version

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.20726 2025-07-30 cs.RO 50%

ManiTaskGen: A Comprehensive Task Generator for Benchmarking and Improving Vision-Language Agents on Embodied Decision-Making

Liu Dai, Haina Wang, Weikang Wan, Hao Su

专题命中 文档图表理解 :vision-language model(abstract)

Comments Project Website: https://manitaskgen.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.16768 2025-06-23 cs.IR 50%

eSapiens: A Real-World NLP Framework for Multimodal Document Understanding and Enterprise Knowledge Processing

Isaac Shi, Zeyuan Li, Wenli Wang, Lewei He, Yang Yang, Tianyu Shi

专题命中 文档图表理解 :grounding(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.17374 2025-05-26 cs.HC cs.CL 50%

Chart-to-Experience: Benchmarking Multimodal LLMs for Predicting Experiential Impact of Charts

Seon Gyeom Kim, Jae Young Choi, Ryan Rossi, Eunyee Koh, Tak Yeon Lee

机构 * KAIST(韩国科学技术院) Adobe Research(Adobe研究院)

专题命中 文档图表理解 :multimodal large language model(abstract)

Comments This paper has been accepted to IEEE PacificVis 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.07730 2025-05-13 cs.IR 50%

Reproducibility, Replicability, and Insights into Visual Document Retrieval with Late Interaction

Jingfen Qiao, Jia-Huei Ju, Xinyu Ma, Evangelos Kanoulas, Andrew Yates

专题命中 文档图表理解 :vision-language model(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.02466 2025-05-06 cs.IR 50%

Tevatron 2.0: Unified Document Retrieval Toolkit across Scale, Language, and Modality

Xueguang Ma, Luyu Gao, Shengyao Zhuang, Jiaqi Samantha Zhan, Jamie Callan, Jimmy Lin

专题命中 文档图表理解 :vision-language model(abstract)

Comments Accepted in SIGIR 2025 (Demo)

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.16688 2025-01-29 cs.CL 50%

MME-Industry: A Cross-Industry Multimodal Evaluation Benchmark

Dongyi Yi, Guibo Zhu, Chenglin Ding, Zongshu Li, Dong Yi, Jinqiao Wang

专题命中 文档图表理解 :multimodal large language model(abstract)

Comments 9 pages,2 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.04026 2024-12-17 cs.CL 50%

M$^{3}$D: A Multimodal, Multilingual and Multitask Dataset for Grounded Document-level Information Extraction

Jiang Liu, Bobo Li, Xinran Yang, Na Yang, Hao Fei, Mingyao Zhang, Fei Li, Donghong Ji

专题命中 文档图表理解 :grounding(abstract)

Comments 14 pages, 9 figures, 6 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2406.11251 2024-12-03 cs.IR 50%

Unifying Multimodal Retrieval via Document Screenshot Embedding

Xueguang Ma, Sheng-Chieh Lin, Minghan Li, Wenhu Chen, Jimmy Lin

专题命中 文档图表理解 :vision-language model(abstract)

Comments EMNLP2024 main

详情

展开后加载摘要…

URL PDF HTML 收藏
2409.17073 2024-11-26 cs.CL 50%

Enhancing Post-Hoc Attributions in Long Document Comprehension via Coarse Grained Answer Decomposition

Pritika Ramu, Koustava Goswami, Apoorv Saxena, Balaji Vasan Srinivasan

专题命中 文档图表理解 :grounding(abstract)

Comments EMNLP 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.16804 2024-10-23 cs.RO 50%

Combining Ontological Knowledge and Large Language Model for User-Friendly Service Robots

Haru Nakajima, Jun Miura

专题命中 文档图表理解 :visual language model(abstract)

Comments Accepted to IEEE/RSJ International Conference on Intelligent Robots and Systems (IROS2024)

详情

展开后加载摘要…

URL PDF HTML 收藏
2312.10160 2024-05-31 cs.CL 50%

Do LVLMs Understand Charts? Analyzing and Correcting Factual Errors in Chart Captioning

Kung-Hsiang Huang, Mingyang Zhou, Hou Pong Chan, Yi R. Fung, Zhenhailong Wang, Lingyu Zhang, Shih-Fu Chang, Heng Ji

专题命中 文档图表理解 :vision-language model(abstract)

Comments ACL 2024 Findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2404.04003 2024-04-08 cs.CL 50%

BuDDIE: A Business Document Dataset for Multi-task Information Extraction

Ran Zmigrod, Dongsheng Wang, Mathieu Sibue, Yulong Pei, Petr Babkin, Ivan Brugere, Xiaomo Liu, Nacho Navarro, Antony Papadimitriou, William Watson, Zhiqiang Ma, Armineh Nourbakhsh, Sameena Shah

专题命中 文档图表理解 :visual question answering(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2305.12191 2023-12-04 cs.CL 50%

Pointwise Mutual Information Based Metric and Decoding Strategy for Faithful Generation in Document Grounded Dialogs

Yatin Nandwani, Vineet Kumar, Dinesh Raghu, Sachindra Joshi, Luis A. Lastras

专题命中 文档图表理解 :grounding(abstract)

Comments EMNLP 2023

详情

展开后加载摘要…

URL PDF HTML 收藏
2305.10927 2023-11-07 cs.CL 50%

Causal Document-Grounded Dialogue Pre-training

Yingxiu Zhao, Bowen Yu, Haiyang Yu, Bowen Li, Jinyang Li, Chao Wang, Fei Huang, Yongbin Li, Nevin L. Zhang

专题命中 文档图表理解 :grounding(abstract)

Comments EMNLP 2023 main

详情

展开后加载摘要…

URL PDF HTML 收藏