arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

视觉大模型 / VLM

视觉语言模型、视觉推理、视觉问答、图文理解和视觉 grounding。

共收录 665 信号源:cs.CV, cs.AI, cs.LG

1. 文档图表理解 665 篇

2508.03644 2025-08-06 cs.CL cs.CV cs.IR 57%

Are We on the Right Way for Assessing Document Retrieval-Augmented Generation?

Wenxuan Shen, Mingjia Wang, Yaochen Wang, Dongping Chen, Junjie Yang, Yao Wan, Weiwei Lin

机构 * South China University of Technology(华南理工大学) Huazhong University of Science and Technology(华中科技大学) University of Maryland(马里兰大学)

专题命中 文档图表理解 :multimodal large language model(abstract);分类 cs.CV

Comments In submission. Project website: https://double-bench.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.00311 2025-08-04 cs.CV 57%

DocTron-Formula: Generalized Formula Recognition in Complex and Structured Scenarios

Yufeng Zhong, Zhixiong Zeng, Lei Chen, Longrong Yang, Liming Zheng, Jing Huang, Siqi Yang, Lin Ma

机构 * Meituan(美团)

专题命中 文档图表理解 :vision-language model(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.20145 2025-07-29 cs.CL cs.AI 57%

Multi-Agent Interactive Question Generation Framework for Long Document Understanding

Kesen Wang, Daulet Toibazar, Abdulrahman Alfulayt, Abdulaziz S. Albadawi, Ranya A. Alkahtani, Asma A. Ibrahim, Haneen A. Alhomoud, Sherif Mohamed, Pedro J. Moreno

专题命中 文档图表理解 :vision-language model(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.10510 2025-07-25 cs.CV cs.CL 57%

DEFAME: Dynamic Evidence-based FAct-checking with Multimodal Experts

Tobias Braun, Mark Rothermel, Marcus Rohrbach, Anna Rohrbach

机构 * Technical University of Darmstadt \& hessian.AI, Germany

专题命中 文档图表理解 :MLLM(abstract);分类 cs.CV

Comments ICML 2025 version. 9 pages main paper, 35 pages with appendix, 18 figures and 7 tables. Corrected two inconsistent numbers in Table 2

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.15249 2025-07-22 cs.CV 57%

FreeCus: Free Lunch Subject-driven Customization in Diffusion Transformers

Yanbing Zhang, Zhe Wang, Qin Zhou, Mengping Yang

专题命中 文档图表理解 :multimodal large language model(abstract);分类 cs.CV

Comments Accepted by ICCV 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.14675 2025-07-22 cs.CV cs.CL 57%

Docopilot: Improving Multimodal Models for Document-Level Understanding

Yuchen Duan, Zhe Chen, Yusong Hu, Weiyun Wang, Shenglong Ye, Botian Shi, Lewei Lu, Qibin Hou, Tong Lu, Hongsheng Li, Jifeng Dai, Wenhai Wang

机构 * Shanghai AI Laboratory(上海人工智能实验室) The Chinese University of Hong Kong(香港中文大学) Nanjing University(南京大学) Nankai University(南开大学) Fudan University(复旦大学) Tsinghua University(清华大学) SenseTime Research(商汤科技研究院)

专题命中 文档图表理解 :multimodal large language model(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.12796 2025-07-18 cs.CV 57%

DeQA-Doc: Adapting DeQA-Score to Document Image Quality Assessment

Junjie Gao, Runze Liu, Yingzhe Peng, Shujian Yang, Jin Zhang, Kai Yang, Zhiyuan You

机构 * Ant Group(蚂蚁集团) Southeast University(东南大学) Shanghai Jiao Tong University(上海交通大学) CUHK(香港中文大学) MBZUAI(墨尔本大学人工智能研究所)

专题命中 文档图表理解 :MLLM(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.18424 2025-07-16 cs.AI cs.CL 57%

LongDocURL: a Comprehensive Multimodal Long Document Benchmark Integrating Understanding, Reasoning, and Locating

Chao Deng, Jiale Yuan, Pi Bu, Peijie Wang, Zhong-Zhi Li, Jian Xu, Xiao-Hui Li, Yuan Gao, Jun Song, Bo Zheng, Cheng-Lin Liu

机构 * MAIS, Institute of Automation, Chinese Academy of Sciences(人工智能研究所,中国科学院) School of Artificial Intelligence, University of Chinese Academy of Sciences(人工智能学院,中国科学院大学) Taobao & Tmall Group of Alibaba(阿里巴巴淘宝与天猫集团) Zhongguancun Academy, Beijing(中关村学院,北京)

专题命中 文档图表理解 :vision language model(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.05595 2025-07-09 cs.CV 57%

PaddleOCR 3.0 Technical Report

Cheng Cui, Ting Sun, Manhui Lin, Tingquan Gao, Yubo Zhang, Jiaxuan Liu, Xueqing Wang, Zelun Zhang, Changda Zhou, Hongen Liu, Yue Zhang, Wenyu Lv, Kui Huang, Yichao Zhang, Jing Zhang, Jun Zhang, Yi Liu, Dianhai Yu, Yanjun Ma

机构 * PaddlePaddle Team, Baidu Inc.(百度公司)

专题命中 文档图表理解 :vision-language model(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.04036 2025-07-08 cs.CV 57%

PresentAgent: Multimodal Agent for Presentation Video Generation

Jingwei Shi, Zeyu Zhang, Biao Wu, Yanjie Liang, Meng Fang, Ling Chen, Yang Zhao

机构 * AI Geeks, Australia Australian Artificial Intelligence Institute, Australia(澳大利亚人工智能研究所) University of Liverpool, United Kingdom(利物浦大学) La Trobe University, Australia(拉特罗布大学)

专题命中 文档图表理解 :vision-language model(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.21601 2025-07-03 cs.IR cs.CV 57%

Hierarchical Patch Compression for ColPali: Efficient Multi-Vector Document Retrieval with Dynamic Pruning and Quantization

Duong Bach

机构 * FPT University Sun Asterisk(FPT大学Sun Asterisk)

专题命中 文档图表理解 :vision-language model(abstract);分类 cs.CV

Comments 9 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.21934 2025-06-30 cs.IR cs.CV 57%

CAL-RAG: Retrieval-Augmented Multi-Agent Generation for Content-Aware Layout Design

Najmeh Forouzandehmehr, Reza Yousefi Maragheh, Sriram Kollipara, Kai Zhao, Topojoy Biswas, Evren Korpeoglu, Kannan Achan

机构 * Walmart Global Tech(沃尔玛全球技术)

专题命中 文档图表理解 :grounding(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.21600 2025-06-30 cs.CL cs.AI cs.IR 57%

Structured Attention Matters to Multimodal LLMs in Document Understanding

Chang Liu, Hongkai Chen, Yujun Cai, Hang Wu, Qingwen Ye, Ming-Hsuan Yang, Yiwei Wang

机构 * vivo Mobile Communication Co., Ltd(vivo移动通信有限公司) The University of Queensland(昆士兰大学) University of California, Merced(加州大学默塞德分校)

专题命中 文档图表理解 :multimodal large language model(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.20326 2025-06-26 cs.CV cs.CL cs.DB 57%

From Codicology to Code: A Comparative Study of Transformer and YOLO-based Detectors for Layout Analysis in Historical Documents

Sergio Torres Aguilar

机构 * University of Luxembourg(卢森堡大学)

专题命中 文档图表理解 :grounding(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.15195 2025-06-24 cs.CV 57%

Benchmarking Large Language Models for Handwritten Text Recognition

Giorgia Crosilla, Lukas Klic, Giovanni Colavizza

专题命中 文档图表理解 :multimodal large language model(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.05061 2025-06-06 cs.CV 57%

A Survey on Vietnamese Document Analysis and Recognition: Challenges and Future Directions

Anh Le, Thanh Lam, Dung Nguyen

专题命中 文档图表理解 :vision-language model(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.24600 2025-06-02 cs.CV 57%

SARD: A Large-Scale Synthetic Arabic OCR Dataset for Book-Style Text Recognition

Omer Nacar, Yasser Al-Habashi, Serry Sibaee, Adel Ammar, Wadii Boulila

专题命中 文档图表理解 :vision-language model(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.11015 2025-05-28 cs.CV 57%

WildDoc: How Far Are We from Achieving Comprehensive and Robust Document Understanding in the Wild?

An-Lan Wang, Jingqun Tang, Liao Lei, Hao Feng, Qi Liu, Xiang Fei, Jinghui Lu, Han Wang, Weiwei Liu, Hao Liu, Yuliang Liu, Xiang Bai, Can Huang

机构 * ByteDance, China(字节跳动,中国) Huazhong University of Science and Technology, China(华中科技大学,中国)

专题命中 文档图表理解 :multimodal large language model(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.18142 2025-05-27 cs.CV cs.DB 57%

TokBench: Evaluating Your Visual Tokenizer before Visual Generation

Junfeng Wu, Dongliang Luo, Weizhi Zhao, Zhihao Xie, Yuanhao Wang, Junyi Li, Xudong Xie, Yuliang Liu, Xiang Bai

机构 * Huazhong University of Science and Technology(华中科技大学)

专题命中 文档图表理解 :VLM(abstract);分类 cs.CV

Comments Benchmark, homepagee: https://wjf5203.github.io/TokBench

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.17235 2025-05-26 cs.CV cs.CL 57%

CHAOS: Chart Analysis with Outlier Samples

Omar Moured, Yufan Chen, Ruiping Liu, Simon Reiß, Philip Torr, Jiaming Zhang, Rainer Stiefelhagen

机构 * Karlsruhe Institute of Technology(卡尔斯鲁厄理工学院) University of Oxford(牛津大学)

专题命中 文档图表理解 :multimodal large language model(abstract);分类 cs.CV

Comments Data and code are publicly available at: http://huggingface.co/datasets/omoured/CHAOS

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.11651 2025-05-22 cs.IR cs.CV 57%

MIRACL-VISION: A Large, multilingual, visual document retrieval benchmark

Radek Osmulski, Gabriel de Souza P. Moreira, Ronay Ak, Mengyao Xu, Benedikt Schifferer, Even Oldridge

机构 * The Thørväld Group(Thørväld集团) Inria Paris-Rocquencourt(巴黎-罗克琴库尔Inria) Rajiv Gandhi University Doimukh(拉朱·甘地大学多伊穆克) Tsinghua University(清华大学) Palmer Research Laboratories(Palmer研究实验室) The Kumquat Consortium(Kumquat联盟)

专题命中 文档图表理解 :VLM(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.14846 2025-05-22 cs.CV cs.CL 57%

Scaling Text-Rich Image Understanding via Code-Guided Synthetic Multimodal Data Generation

Yue Yang, Ajay Patel, Matt Deitke, Tanmay Gupta, Luca Weihs, Andrew Head, Mark Yatskar, Chris Callison-Burch, Ranjay Krishna, Aniruddha Kembhavi, Christopher Clark

机构 * University of Pennsylvania(宾夕法尼亚大学) Allen Institute for Artificial Intelligence(人工智能研究所)

专题命中 文档图表理解 :vision-language model(abstract);分类 cs.CV

Comments Published in ACL 2025, project page: https://yueyang1996.github.io/cosyn/

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.00746 2025-05-07 cs.CV 57%

Entropy Heat-Mapping: Localizing GPT-Based OCR Errors with Sliding-Window Shannon Analysis

Alexei Kaltchenko

机构 * Wilfrid Laurier University(威尔弗里德·劳里埃大学)

专题命中 文档图表理解 :vision-language model(abstract);分类 cs.CV

Comments 22 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.23667 2025-04-01 cs.CV 57%

Context-Independent OCR with Multimodal LLMs: Effects of Image Resolution and Visual Complexity

Kotaro Inoue

专题命中 文档图表理解 :multimodal large language model(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2406.20085 2025-03-25 cs.CV 57%

Auto Cherry-Picker: Learning from High-quality Generative Data Driven by Language

Yicheng Chen, Xiangtai Li, Yining Li, Yanhong Zeng, Jianzong Wu, Xiangyu Zhao, Kai Chen

专题命中 文档图表理解 :MLLM(abstract);分类 cs.CV

Comments Accepted to CVPR2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2408.15045 2025-03-20 cs.CV 57%

DocLayLLM: An Efficient Multi-modal Extension of Large Language Models for Text-rich Document Understanding

Wenhui Liao, Jiapeng Wang, Hongliang Li, Chengyu Wang, Jun Huang, Lianwen Jin

专题命中 文档图表理解 :multimodal large language model(abstract);分类 cs.CV

Comments CVPR2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.13964 2025-03-19 cs.LG 57%

MDocAgent: A Multi-Modal Multi-Agent Framework for Document Understanding

Siwei Han, Peng Xia, Ruiyi Zhang, Tong Sun, Yun Li, Hongtu Zhu, Huaxiu Yao

专题命中 文档图表理解 :vision language model(abstract);分类 cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.04237 2025-03-12 cs.CV 57%

VASCAR: Content-Aware Layout Generation via Visual-Aware Self-Correction

Jiahao Zhang, Ryota Yoshihashi, Shunsuke Kitada, Atsuki Osanai, Yuta Nakashima

专题命中 文档图表理解 :vision-language model(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2406.07209 2025-03-05 cs.CV 57%

MS-Diffusion: Multi-subject Zero-shot Image Personalization with Layout Guidance

Xierui Wang, Siming Fu, Qihan Huang, Wanggui He, Hao Jiang

专题命中 文档图表理解 :grounding(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.00591 2025-03-04 cs.CV 57%

AesthetiQ: Enhancing Graphic Layout Design via Aesthetic-Aware Preference Alignment of Multi-modal Large Language Models

Sohan Patnaik, Rishabh Jain, Balaji Krishnamurthy, Mausoom Sarkar

专题命中 文档图表理解 :MLLM(abstract);分类 cs.CV

Comments Accepted for publication in CVPR 2025

详情

展开后加载摘要…

URL PDF HTML 收藏