arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

视觉大模型 / VLM

视觉语言模型、视觉推理、视觉问答、图文理解和视觉 grounding。

共收录 665 信号源:cs.CV, cs.AI, cs.LG

1. 文档图表理解 665 篇

2502.15979 2025-02-25 cs.IR cs.CV 57%

Visual Zero-Shot E-Commerce Product Attribute Value Extraction

Jiaying Gong, Ming Cheng, Hongda Shen, Pierre-Yves Vandenbussche, Janet Jenq, Hoda Eldardiry

专题命中 文档图表理解 :vision-language model(abstract);分类 cs.CV

Comments 10 pages, 4 figures, accepted for publication in NAACL 2025 Industry Track

详情

展开后加载摘要…

URL PDF HTML 收藏
2403.03163 2025-02-11 cs.CL cs.CV cs.CY 57%

Design2Code: Benchmarking Multimodal Code Generation for Automated Front-End Engineering

Chenglei Si, Yanzhe Zhang, Ryan Li, Zhengyuan Yang, Ruibo Liu, Diyi Yang

专题命中 文档图表理解 :multimodal large language model(abstract);分类 cs.CV

Comments NAACL 2025; The first two authors contributed equally

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.04223 2025-02-07 cs.CV 57%

Éclair -- Extracting Content and Layout with Integrated Reading Order for Documents

Ilia Karmanov, Amala Sanjay Deshmukh, Lukas Voegtle, Philipp Fischer, Kateryna Chumachenko, Timo Roman, Jarno Seppänen, Jupinder Parmar, Joseph Jennings, Andrew Tao, Karan Sapra

专题命中 文档图表理解 :vision language model(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.03692 2025-02-07 cs.LG cs.CL cs.CR 57%

DocMIA: Document-Level Membership Inference Attacks against DocVQA Models

Khanh Nguyen, Raouf Kerkouche, Mario Fritz, Dimosthenis Karatzas

专题命中 文档图表理解 :visual question answering(abstract);分类 cs.LG

Comments ICLR 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.20613 2024-12-31 cs.CV 57%

Do Current Video LLMs Have Strong OCR Abilities? A Preliminary Study

Yulin Fei, Yuhui Gao, Xingyuan Xian, Xiaojin Zhang, Tao Wu, Wei Chen

专题命中 文档图表理解 :multimodal large language model(abstract);分类 cs.CV

Comments Accepted by CoLing 2025 (The 31st International Conference on Computational Linguistics)

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.13702 2024-12-20 cs.CL cs.AI 57%

Typhoon 2: A Family of Open Text and Multimodal Thai Large Language Models

Kunat Pipatanakul, Potsawee Manakul, Natapong Nitarach, Warit Sirichotedumrong, Surapon Nonesung, Teetouch Jaknamon, Parinthapat Pengpun, Pittawat Taveekitworachai, Adisai Na-Thalang, Sittipong Sripaisarnmongkol, Krisanapong Jirayoot, Kasima Tharnpipitchai

专题命中 文档图表理解 :multimodal large language model(abstract);分类 cs.AI

Comments technical report, 55 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2305.07895 2024-12-17 cs.CV cs.CL 57%

OCRBench: On the Hidden Mystery of OCR in Large Multimodal Models

Yuliang Liu, Zhang Li, Mingxin Huang, Biao Yang, Wenwen Yu, Chunyuan Li, Xucheng Yin, Cheng-lin Liu, Lianwen Jin, Xiang Bai

专题命中 文档图表理解 :visual question answering(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.02210 2024-12-11 cs.CV 57%

CC-OCR: A Comprehensive and Challenging OCR Benchmark for Evaluating Large Multimodal Models in Literacy

Zhibo Yang, Jun Tang, Zhaohai Li, Pengfei Wang, Jianqiang Wan, Humen Zhong, Xuejing Liu, Mingkun Yang, Peng Wang, Shuai Bai, LianWen Jin, Junyang Lin

专题命中 文档图表理解 :grounding(abstract);分类 cs.CV

Comments 23 pages, 14 figures; The code will be released soon

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.05311 2024-12-10 cs.AR cs.AI 57%

DRC-Coder: Automated DRC Checker Code Generation Using LLM Autonomous Agent

Chen-Chia Chang, Chia-Tung Ho, Yaguang Li, Yiran Chen, Haoxing Ren

专题命中 文档图表理解 :vision language model(abstract);分类 cs.AI

Comments Proceedings of the 2025 International Symposium on Physical Design (ISPD '25), March 16--19, 2025, Austin, TX, USA

详情

展开后加载摘要…

URL PDF HTML 收藏
2406.02884 2024-11-27 cs.CV 57%

PosterLLaVa: Constructing a Unified Multi-modal Layout Generator with LLM

Tao Yang, Yingmin Luo, Zhongang Qi, Yang Wu, Ying Shan, Chang Wen Chen

专题命中 文档图表理解 :MLLM(abstract);分类 cs.CV

Comments 13 pages; with PosterGen as extension; IEEE template

详情

展开后加载摘要…

URL PDF HTML 收藏
2407.01523 2024-11-13 cs.CV cs.CL 57%

MMLongBench-Doc: Benchmarking Long-context Document Understanding with Visualizations

Yubo Ma, Yuhang Zang, Liangyu Chen, Meiqi Chen, Yizhu Jiao, Xinze Li, Xinyuan Lu, Ziyu Liu, Yan Ma, Xiaoyi Dong, Pan Zhang, Liangming Pan, Yu-Gang Jiang, Jiaqi Wang, Yixin Cao, Aixin Sun

专题命中 文档图表理解 :vision-language model(abstract);分类 cs.CV

Comments Accepted to NeurIPS 2024 Datasets and Benchmarks Track (Spotlight)

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.05254 2024-11-11 cs.CV 57%

Hierarchical Visual Feature Aggregation for OCR-Free Document Understanding

Jaeyoo Park, Jin Young Choi, Jeonghyung Park, Bohyung Han

专题命中 文档图表理解 :multimodal large language model(abstract);分类 cs.CV

Comments NeurIPS 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.13824 2024-11-07 cs.CV cs.CL 57%

Harnessing Webpage UIs for Text-Rich Visual Understanding

Junpeng Liu, Tianyue Ou, Yifan Song, Yuxiao Qu, Wai Lam, Chenyan Xiong, Wenhu Chen, Graham Neubig, Xiang Yue

专题命中 文档图表理解 :multimodal large language model(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2402.05121 2024-11-05 cs.AI cs.CL 57%

Large Language Model for Table Processing: A Survey

Weizheng Lu, Jing Zhang, Ju Fan, Zihao Fu, Yueguo Chen, Xiaoyong Du

专题命中 文档图表理解 :visual language model(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2407.11965 2024-10-23 cs.CV 57%

UrbanWorld: An Urban World Model for 3D City Generation

Yu Shang, Yuming Lin, Yu Zheng, Hangyu Fan, Jingtao Ding, Jie Feng, Jiansheng Chen, Li Tian, Yong Li

专题命中 文档图表理解 :MLLM(abstract);分类 cs.CV

Comments 14 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2409.11500 2024-09-19 cs.CL cs.AI 57%

Multi-Document Grounded Multi-Turn Synthetic Dialog Generation

Young-Suk Lee, Chulaka Gunasekara, Danish Contractor, Ramón Fernandez Astudillo, Radu Florian

专题命中 文档图表理解 :grounding(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2406.11633 2024-09-12 cs.CV 57%

DocGenome: An Open Large-scale Scientific Document Benchmark for Training and Testing Multi-modal Large Language Models

Renqiu Xia, Song Mao, Xiangchao Yan, Hongbin Zhou, Bo Zhang, Haoyang Peng, Jiahao Pi, Daocheng Fu, Wenjie Wu, Hancheng Ye, Shiyang Feng, Bin Wang, Chao Xu, Conghui He, Pinlong Cai, Min Dou, Botian Shi, Sheng Zhou, Yongwei Wang, Bin Wang, Junchi Yan, Fei Wu, Yu Qiao

专题命中 文档图表理解 :grounding(abstract);分类 cs.CV

Comments Homepage of DocGenome: https://unimodal4reasoning.github.io/DocGenome_page 22 pages, 11 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2405.14213 2024-08-27 cs.CV cs.CL 57%

From Text to Pixel: Advancing Long-Context Understanding in MLLMs

Yujie Lu, Xiujun Li, Tsu-Jui Fu, Miguel Eckstein, William Yang Wang

专题命中 文档图表理解 :multimodal large language model(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2407.14439 2024-07-22 cs.CV 57%

Token-level Correlation-guided Compression for Efficient Multimodal Document Understanding

Renshan Zhang, Yibo Lyu, Rui Shao, Gongwei Chen, Weili Guan, Liqiang Nie

专题命中 文档图表理解 :multimodal large language model(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2403.02558 2024-07-15 cs.CL cs.CV 57%

The Minimum Information about CLinical Artificial Intelligence Checklist for Generative Modeling Research (MI-CLAIM-GEN)

Brenda Y. Miao, Irene Y. Chen, Christopher YK Williams, Jaysón Davidson, Augusto Garcia-Agundez, Shenghuan Sun, Travis Zack, Suchi Saria, Rima Arnaout, Giorgio Quer, Hossein J. Sadaei, Ali Torkamani, Brett Beaulieu-Jones, Bin Yu, Milena Gianfrancesco, Atul J. Butte, Beau Norgeot, Madhumita Sushil

专题命中 文档图表理解 :vision language model(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2406.06556 2024-06-12 cs.CL cs.AI 57%

Enhancing Presentation Slide Generation by LLMs with a Multi-Staged End-to-End Approach

Sambaran Bandyopadhyay, Himanshu Maheshwari, Anandhavelu Natarajan, Apoorv Saxena

专题命中 文档图表理解 :VLM(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2401.13478 2024-06-12 cs.IR cs.CL cs.CV cs.MM 57%

SciMMIR: Benchmarking Scientific Multi-modal Information Retrieval

Siwei Wu, Yizhi Li, Kang Zhu, Ge Zhang, Yiming Liang, Kaijing Ma, Chenghao Xiao, Haoran Zhang, Bohao Yang, Wenhu Chen, Wenhao Huang, Noura Al Moubayed, Jie Fu, Chenghua Lin

专题命中 文档图表理解 :visual language model(abstract);分类 cs.CV

Comments camera-ready version for ACL 2024 Findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2405.08037 2024-05-15 cs.HC cs.AI 57%

Layout Generation Agents with Large Language Models

Yuichi Sasazawa, Yasuhiro Sogawa

专题命中 文档图表理解 :multimodal large language model(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2405.00260 2024-05-02 cs.CV 57%

CREPE: Coordinate-Aware End-to-End Document Parser

Yamato Okamoto, Youngmin Baek, Geewook Kim, Ryota Nakao, DongHyun Kim, Moon Bin Yim, Seunghyun Park, Bado Lee

专题命中 文档图表理解 :visual question answering(abstract);分类 cs.CV

Comments Accepted at the International Conference on Document Analysis and Recognition (ICDAR 2024) main conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2404.09797 2024-04-16 cs.CV 57%

TextCoT: Zoom In for Enhanced Multimodal Text-Rich Image Understanding

Bozhi Luan, Hao Feng, Hong Chen, Yonghui Wang, Wengang Zhou, Houqiang Li

专题命中 文档图表理解 :grounding(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2404.06918 2024-04-11 cs.CV 57%

HRVDA: High-Resolution Visual Document Assistant

Chaohu Liu, Kun Yin, Haoyu Cao, Xinghua Jiang, Xin Li, Yinsong Liu, Deqiang Jiang, Xing Sun, Linli Xu

专题命中 文档图表理解 :multimodal large language model(abstract);分类 cs.CV

Comments Accepted to CVPR 2024 main conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2403.12895 2024-03-20 cs.CV 57%

mPLUG-DocOwl 1.5: Unified Structure Learning for OCR-free Document Understanding

Anwen Hu, Haiyang Xu, Jiabo Ye, Ming Yan, Liang Zhang, Bo Zhang, Chen Li, Ji Zhang, Qin Jin, Fei Huang, Jingren Zhou

专题命中 文档图表理解 :multimodal large language model(abstract);分类 cs.CV

Comments 21 pages, 15 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2403.09675 2024-03-18 cs.CV cs.GR 57%

Open-Universe Indoor Scene Generation using LLM Program Synthesis and Uncurated Object Databases

Rio Aguina-Kang, Maxim Gumin, Do Heon Han, Stewart Morris, Seung Jean Yoo, Aditya Ganeshan, R. Kenny Jones, Qiuhong Anna Wei, Kailiang Fu, Daniel Ritchie

专题命中 文档图表理解 :vision-language model(abstract);分类 cs.CV

Comments See ancillary files for link to supplemental material

详情

展开后加载摘要…

URL PDF HTML 收藏
2401.02384 2024-02-16 cs.CV 57%

ChartAssisstant: A Universal Chart Multimodal Language Model via Chart-to-Table Pre-training and Multitask Instruction Tuning

Fanqing Meng, Wenqi Shao, Quanfeng Lu, Peng Gao, Kaipeng Zhang, Yu Qiao, Ping Luo

专题命中 文档图表理解 :vision-language model(abstract);分类 cs.CV

Comments Updated and corrected experimental results, removal of inappropriate experiments, and a more comprehensive experimental setup

详情

展开后加载摘要…

URL PDF HTML 收藏
2402.06116 2024-02-12 cs.RO cs.AI 57%

LLMs for Coding and Robotics Education

Peng Shu, Huaqin Zhao, Hanqi Jiang, Yiwei Li, Shaochen Xu, Yi Pan, Zihao Wu, Zhengliang Liu, Guoyu Lu, Le Guan, Gong Chen, Xianqiao Wang Tianming Liu

专题命中 文档图表理解 :multimodal large language model(abstract);分类 cs.AI

Comments 20 pages, 6 figures, 1 table

详情

展开后加载摘要…

URL PDF HTML 收藏