arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

视觉大模型 / VLM

视觉语言模型、视觉推理、视觉问答、图文理解和视觉 grounding。

共收录 663 信号源:cs.CV, cs.AI, cs.LG

1. 文档图表理解 663 篇

2512.13303 2026-03-27 cs.CV 57%

ShowTable: Unlocking Creative Table Visualization with Collaborative Reflection and Refinement

ShowTable:通过协作反思与精炼解锁创意表格可视化

Zhihang Liu, Xiaoyi Bao, Pandeng Li, Junjie Zhou, Zhaohe Liao, Yefei He, Kaixun Jiang, Chen-Wei Xie, Yun Zheng, Hongtao Xie

机构 * USTC(中国科学技术大学) CASIA(中国科学院自动化研究所) NJU(南京大学) SJTU(上海交通大学) ZJU(浙江大学) FDU(福建师范大学) Tongyi Lab(通义实验室)

专题命中 文档图表理解 :MLLM(abstract);分类 cs.CV

AI总结 本文提出ShowTable框架,结合大语言模型与扩散模型,通过逐步自我纠正过程实现创意表格可视化,引入TableVisBench基准测试,展示其在多模态推理、生成和纠错方面的优势。

Comments Accepted to CVPR 2026, project page: https://lntzm.github.io/showtable-page/

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.22458 2026-03-25 cs.CV 57%

MinerU-Diffusion: Rethinking Document OCR as Inverse Rendering via Diffusion Decoding

MinerU-Diffusion:通过扩散解码重新思考文档OCR作为逆向渲染

Hejun Dong, Junbo Niu, Bin Wang, Weijun Zeng, Wentao Zhang, Conghui He

机构 * Shanghai Artificial Intelligence Laboratory, OpenDataLab(上海人工智能实验室,OpenDataLab) Peking University(北京大学)

专题命中 文档图表理解 :vision-language model(abstract);分类 cs.CV

AI总结 本文提出MinerU-Diffusion,通过扩散解码替代自回归解码,提升文档OCR的鲁棒性和效率,实验表明其在长序列推理中速度提升3.2倍,且在视觉OCR能力上表现更优。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.18001 2026-03-19 cs.CV 57%

EchoGen: Cycle-Consistent Learning for Unified Layout-Image Generation and Understanding

EchoGen:基于循环一致性的统一布局-图像生成与理解学习

Kai Zou, Hongbo Liu, Dian Zheng, Jianxiong Gao, Zhiwei Zhao, Bin Liu

机构 * School of Cyber Science and Technology, University of Science and Technology of China(中国科学技术大学信息科学与技术学院) Tongji University(同济大学) Sun Yat-sen University(中山大学) Fudan University(复旦大学) Hefei University of Technology(合肥工业大学) Anhui Province Key Laboratory of Digital Security(安徽省数字安全重点实验室)

专题命中 文档图表理解 :grounding(abstract);分类 cs.CV

AI总结 本文提出EchoGen框架,通过统一模型联合训练布局到图像生成和图像定位任务,提升生成图像的布局准确性与文本描述一致性,同时增强图像定位的鲁棒性。

Comments 9 pages, Accepted at the 40th AAAI Conference on Artificial Intelligence (AAAI 2026)

Journal ref Proceedings of the AAAI Conference on Artificial Intelligence, 40(16), 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.15206 2026-03-17 cs.CL cs.CV 57%

Efficient Document Parsing via Parallel Token Prediction

通过并行标记预测实现高效的文档解析

Lei Li, Ze Zhao, Meng Li, Zhongwang Lun, Yi Yuan, Xingjing Lu, Zheng Wei, Jiang Bian, Zang Li

机构 * Platform and Content Group, Tencent(腾讯平台与内容组) Renmin University of China(中国人民大学)

专题命中 文档图表理解 :vision-language model(abstract);分类 cs.CV

AI总结 本文提出并行标记预测方法,通过在输入序列中插入可学习标记并设计训练目标,使VLM在文档解析中实现并行解码,提升解析速度并减少模型幻觉。

Comments Accepted by CVPR 2026 Findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.18333 2026-03-17 cs.CV 57%

ConsistCompose: Unified Multimodal Layout Control for Image Composition

ConsistCompose:统一的多模态布局控制用于图像合成

Xuanke Shi, Boxuan Li, Xiaoyang Han, Zhongang Cai, Lei Yang, Quan Wang, Dahua Lin

专题命中 文档图表理解 :grounding(abstract);分类 cs.CV

AI总结 ConsistCompose通过将布局坐标直接嵌入语言提示,实现布局可控的多实例图像生成,并构建了3.4M的多实例生成数据集,提升了布局控制的精度和多模态理解能力。

Comments Accepted to CVPR 2026; 23 pages, 17 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.11846 2026-03-13 cs.CV 57%

ZeroSense:How Vision matters in Long Context Compression

ZeroSense:视觉在长上下文压缩中的作用

Yonghan Gao, Zehong Chen, Lijian Xu, Jingzhi Chen, Jingwei Guan, Xingyu Zeng

专题命中 文档图表理解 :multimodal large language model(abstract);分类 cs.CV

AI总结 本文提出ZeroSense框架,通过解耦多模态大语言模型能力,评估视觉-文本压缩质量,并通过低语义相关性基准测试验证长上下文压缩效果与下游任务准确性之间的显著差异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.08274 2026-03-10 cs.CL cs.AI 57%

How Much Do LLMs Hallucinate in Document Q&A Scenarios? A 172-Billion-Token Study Across Temperatures, Context Lengths, and Hardware Platforms

在文档问答场景中,大型语言模型会有多大的幻觉?一项跨温度、上下文长度和硬件平台的1720亿token研究

JV Roig

机构 * Kamiwaza AI

专题命中 文档图表理解 :grounding(abstract);分类 cs.AI

AI总结 研究通过大规模评估揭示了大型语言模型在文档问答中幻觉率与温度、上下文长度及硬件平台的关系,发现模型选择和温度设置显著影响准确性与伪造率。

Comments 18 pages, 12 tables, 2 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.07494 2026-03-10 cs.CV 57%

DocCogito: Aligning Layout Cognition and Step-Level Grounded Reasoning for Document Understanding

DocCogito: 对齐布局认知与分步 grounded 推理以实现文档理解

Yuchuan Wu, Minghan Zhuo, Teng Fu, Mengyang Zhao, Bin Li, Xiangyang Xue

机构 * Fudan University(复旦大学)

专题命中 文档图表理解 :multimodal large language model(abstract);分类 cs.CV

AI总结 DocCogito通过整合布局感知与结构化推理,提升文档理解的准确性和推理过程的系统性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.07119 2026-03-10 cs.CV 57%

TIQA: Human-Aligned Text Quality Assessment in Generated Images

TIQA: 生成图像中的人工对齐文本质量评估

Kirill Koltsov, Aleksandr Gushchin, Dmitriy Vatolin, Anastasia Antsiferova

机构 * Lomonosov Moscow State University(洛蒙诺索夫莫斯科国立大学) ISP RAS Research Center for Trusted Artificial Intelligence(俄罗斯科学院信息与系统研究所在可信人工智能领域研究中心) MSU Institute for Artificial Intelligence(莫斯科大学人工智能研究所)

专题命中 文档图表理解 :VLM(abstract);分类 cs.CV

AI总结 TIQA通过ANTIQA方法提升生成图像中文本质量评估的准确性,有效提高文本生成任务的过滤与重排序性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.06958 2026-03-10 cs.LG cs.CL 57%

Chart-RL: Generalized Chart Comprehension via Reinforcement Learning with Verifiable Rewards

Chart-RL: 通过可验证奖励的强化学习实现通用图表理解

Xin Zhang, Xingyu Li, Rongguang Wang, Ruizhong Miao, Zheng Wang, Dan Roth, Chenyang Li

机构 * Oracle AI

专题命中 文档图表理解 :vision-language model(abstract);分类 cs.LG

AI总结 Chart-RL通过可验证奖励的强化学习提升图表理解能力,在多个基准测试中超越监督微调,展现强大的泛化和迁移能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.03302 2026-03-05 cs.CL cs.AI cs.IR 57%

Developing an AI Assistant for Knowledge Management and Workforce Training in State DOTs

为州交通部门的知识管理和员工培训开发人工智能助手

Divija Amaram, Lu Gao, Gowtham Reddy Gudla, Tejaswini Sanjay Katale

机构 * Department of Computer Science, University of Houston(计算机科学系,休斯顿大学) Department of Civil and Environmental Engineering, University of Houston(土木与环境工程系,休斯顿大学) Ph.D Department of Civil and Environmental Engineering, University of Houston(土木与环境工程系,休斯顿大学) Engineering Data Science, University of Houston(工程数据科学,休斯顿大学)

专题命中 文档图表理解 :vision-language model(abstract);分类 cs.AI

AI总结 本文提出了一种多代理架构的RAG框架,用于州交通部门的知识管理和决策支持,通过整合文档检索与大语言模型生成,提升信息检索与响应质量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.00476 2026-03-03 cs.CR cs.AI 57%

Atomicity for Agents: Exposing, Exploiting, and Mitigating TOCTOU Vulnerabilities in Browser-Use Agents

代理的原子性:揭示、利用和缓解浏览器使用代理中的TOCTOU漏洞

Linxi Jiang, Zhijie Liu, Haotian Luo, Zhiqiang Lin

机构 * The Ohio State University(俄亥俄州立大学)

专题命中 文档图表理解 :vision language model(abstract);分类 cs.AI

AI总结 本文研究了浏览器使用代理中的TOCTOU漏洞,通过实证研究揭示其普遍存在性,并提出基于预执行验证的轻量级缓解方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.21824 2026-02-26 cs.LG 57%

DocDjinn: Controllable Synthetic Document Generation with VLMs and Handwriting Diffusion

DocDjinn: 基于VLMs和手写扩散的可控合成文档生成

Marcel Lamott, Saifullah Saifullah, Nauman Riaz, Yves-Noel Weweler, Tobias Alt-Veit, Ahmad Sarmad Ali, Muhammad Armaghan Shakir, Adrian Kalwa, Momina Moetesum, Andreas Dengel, Sheraz Ahmed, Faisal Shafait, Ulrich Schwanecke, Adrian Ulges

机构 * RheinMain University of Applied Sciences(莱茵-美因应用科学大学) German Research Center for Artificial Intelligence(德国人工智能研究中心) DeepReader GmbH(DeepReader公司) Insiders Technologies GmbH(Insiders Technologies公司) National University of Sciences and Technology(国家科学与技术大学)

专题命中 文档图表理解 :vision-language model(abstract);分类 cs.LG

AI总结 DocDjinn利用VLMs和手写扩散生成可控合成文档,通过聚类和参数化采样从未标注种子生成高质量标注文档,实现隐私保护和高效数据生成。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.21053 2026-02-25 cs.CV 57%

OCR-Agent: Agentic OCR with Capability and Memory Reflection

OCR-Agent: 具有能力和记忆反思的代理OCR

Shimin Wen, Zeyu Zhang, Xingdou Bian, Hongjie Zhu, Lulu He, Layi Shama, Daji Ergu, Ying Cai

机构 * Southwest Minzu University(西南民族大学) AI Geeks

专题命中 文档图表理解 :vision-language model(abstract);分类 cs.CV

AI总结 OCR-Agent通过能力反思和记忆反思机制,提升VLMs的推理鲁棒性,实现更稳定的答案质量改进。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.19193 2026-02-24 cs.RO cs.AI 57%

Visual Prompt Guided Unified Pushing Policy

基于视觉提示的统一推送策略

Hieu Bui, Ziyan Gao, Yuya Hosoda, Joo-Ho Lee

机构 * Graduate School of Information Science and Engineering, Ritsumeikan University, Japan(立命馆大学信息科学与工程研究生院) Japan Advanced Institute of Science and Technology (JAIST)(日本先进科学研究院) College of Information Science and Engineering, Ritsumeikan University, Japan(立命馆大学信息科学与工程学院)

专题命中 文档图表理解 :VLM(abstract);分类 cs.AI

AI总结 本文提出一种基于视觉提示的统一推送策略,通过整合轻量级提示机制提升多模态推送动作的生成效率,适用于广泛规划问题,并在桌面清洁任务中表现出色。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.18731 2026-02-24 cs.AI 57%

Beyond Description: A Multimodal Agent Framework for Insightful Chart Summarization

超越描述:一种多模态代理框架用于深入的图表摘要

Yuhang Bai, Yujuan Ding, Shanru Lin, Wenqi Fan

机构 * The Hong Kong Polytechnic University(香港理工大学) City University of Hong Kong(香港城市大学)

专题命中 文档图表理解 :multimodal large language model(abstract);分类 cs.AI

AI总结 本文提出多模态代理框架Chart Insight Agent Flow,通过结合MLLMs的感知与推理能力,提升图表摘要的深度和多样性,并引入新数据集ChartSummInsights以支持研究。

Comments 5 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.16455 2026-02-19 cs.CV 57%

Visual Self-Refine: A Pixel-Guided Paradigm for Accurate Chart Parsing

视觉自校准:一种像素引导的准确图表解析范式

Jinsong Li, Xiaoyi Dong, Yuhang Zang, Yuhang Cao, Jiaqi Wang, Dahua Lin

机构 * The Chinese University of Hong Kong(香港中文大学) Shanghai AI Laboratory(上海人工智能实验室) CPII under InnoHK(创新香港下的CPII) Shanghai Innovation Institute(上海创新研究院)

专题命中 文档图表理解 :vision-language model(abstract);分类 cs.CV

AI总结 本文提出视觉自校准范式,通过像素引导提升图表解析的准确性,并构建了新的挑战性基准测试ChartP-Bench。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.15758 2026-02-18 cs.CL cs.AI 57%

ChartEditBench: Evaluating Grounded Multi-Turn Chart Editing in Multimodal Language Models

ChartEditBench: 评估多轮视觉引导图表编辑在多模态语言模型中的表现

Manav Nitin Kapadnis, Lawanya Baghel, Atharva Naik, Carolyn Rosé

专题命中 文档图表理解 :multimodal large language model(abstract);分类 cs.AI

AI总结 ChartEditBench通过代码进行多轮视觉引导图表编辑,评估多模态语言模型在持续、上下文感知编辑中的表现,揭示了多轮交互中错误累积和共享上下文失效的问题。

Comments 16 pages, 13 figures including Supplementary Material

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.13345 2026-02-17 cs.LG cs.IR cs.MA 57%

BLUEPRINT Rebuilding a Legacy: Multimodal Retrieval for Complex Engineering Drawings and Documents

BLUEPRINT 重筑遗产:面向复杂工程图纸和文档的多模态检索

Ethan Seefried, Ran Eldegaway, Sanjay Das, Nathaniel Blanchard, Tirthankar Ghosal

机构 * Oak Ridge National Laboratory(橡树岭国家实验室) Colorado State University(科罗拉多州立大学)

专题命中 文档图表理解 :VLM(abstract);分类 cs.LG

AI总结 Blueprint通过布局感知的多模态检索系统,提升对复杂工程图纸和文档的自动化检索能力,实现结构化元数据生成与跨设施搜索效率提升。

Comments 20 pages 8 main + 12 appendix + references

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.21205 2026-02-13 cs.CV cs.CL 57%

TABLET: A Large-Scale Dataset for Robust Visual Table Understanding

TABLET:一个大规模数据集,用于鲁棒的视觉表格理解

Iñigo Alonso, Imanol Miranda, Eneko Agirre, Mirella Lapata

机构 * School of Informatics, University of Edinburgh(爱丁堡大学信息学院) HiTZ Center - Ixa, University of the Basque Country UPV/EHU(巴斯克国家大学HiTZ中心)

专题命中 文档图表理解 :vision-language model(abstract);分类 cs.CV

AI总结 TABLET是一个大规模视觉表格理解数据集,包含400万个示例和21项任务,旨在提升模型对真实世界表格可视化的鲁棒性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.11156 2026-02-13 cs.CL cs.AI cs.IR 57%

HybridRAG: A Practical LLM-based ChatBot Framework based on Pre-Generated Q&A over Raw Unstructured Documents

HybridRAG: 一种基于预生成问答的LLM聊天机器人框架

Sungmoon Kim, Hyuna Jeon, Dahye Kim, Mingyu Kim, Dong-Kyu Chae, Jiwoong Kim

机构 * Hanyang University(翰阳大学) Makebot Inc.(Makebot公司)

专题命中 文档图表理解 :grounding(abstract);分类 cs.AI

AI总结 HybridRAG通过预生成问答库和实时生成相结合,提升聊天机器人在处理无结构文档时的准确性和效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.05384 2026-02-06 cs.CV 57%

Dolphin-v2: Universal Document Parsing via Scalable Anchor Prompting

Dolphin-v2:通过可扩展的锚点提示实现通用文档解析

Hao Feng, Wei Shi, Ke Zhang, Xiang Fei, Lei Liao, Dingkang Yang, Yongkun Du, Xuecheng Wu, Jingqun Tang, Yang Liu, Hong Chen, Can Huang

专题命中 文档图表理解 :vision-language model(abstract);分类 cs.CV

AI总结 Dolphin-v2通过可扩展的锚点提示实现通用文档解析,改进了文档类型分类、布局分析和元素检测,提升了对拍摄文档的解析能力并减少错误率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.21694 2026-01-30 cs.CV 57%

ChartE$^{3}$: A Comprehensive Benchmark for End-to-End Chart Editing

ChartE$^{3}$: 一个全面的端到端图表编辑基准

Shuo Li, Jiajun Sun, Zhekai Wang, Xiaoran Fan, Hui Li, Dingwen Yang, Zhiheng Xi, Yijun Wang, Zifei Shan, Tao Gui, Qi Zhang, Xuanjing Huang

机构 * Fudan University(复旦大学) Tencent(腾讯)

专题命中 文档图表理解 :multimodal large language model(abstract);分类 cs.CV

AI总结 ChartE$^{3}$提出一个端到端图表编辑基准,通过多模态大语言模型评估,揭示了现有技术在全局编辑任务上的性能差距。

Comments Our benchmark will be publicly available at https://github.com/galactic123/ChartE3

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.20552 2026-01-29 cs.CV 57%

DeepSeek-OCR 2: Visual Causal Flow

DeepSeek-OCR 2: 视觉因果流

Haoran Wei, Yaofeng Sun, Yukun Li

机构 * DeepSeek-AI

专题命中 文档图表理解 :vision-language model(abstract);分类 cs.CV

AI总结 DeepSeek-OCR 2通过两个级联的一维因果推理结构实现二维图像理解,提升视觉处理的语义连贯性与灵活性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.02729 2026-01-26 cs.CL cs.AI cs.IR 57%

Unified Multimodal Interleaved Document Representation for Retrieval

统一多模态交错文档表示用于检索

Jaewoo Lee, Joonho Ko, Jinheon Baek, Soyeong Jeong, Sung Ju Hwang

机构 * University of North Carolina Chapel Hill(北卡罗来纳大学教堂山分校) KAIST(韩国科学技术院) DeepAuto

专题命中 文档图表理解 :vision-language model(abstract);分类 cs.AI

AI总结 本文提出统一多模态交错文档表示方法,通过整合文本、图像和表格信息提升信息检索性能。

Comments EACL Findings 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.06404 2026-01-19 cs.CV 57%

InfoAffect: Affective Annotations of Infographics in Information Spread

InfoAffect: 信息传播中信息图的情感标注

Zihang Fu, Yunchao Wang, Chenyu Huang, Guodao Sun, Ronghua Liang

专题命中 文档图表理解 :multimodal large language model(abstract);分类 cs.CV

AI总结 InfoAffect数据集通过多模态大语言模型和递归排名融合算法,实现了信息图情感标注的高准确度研究。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.04819 2026-01-09 cs.AI 57%

AECV-Bench: Benchmarking Multimodal Models on Architectural and Engineering Drawings Understanding

AECV-Bench:在建筑和工程图纸理解上的多模态模型评估基准

Aleksei Kondratenko, Mussie Birhane, Houssame E. Hsain, Guido Maciocci

专题命中 文档图表理解 :vision-language model(abstract);分类 cs.AI

AI总结 AECV-Bench评估多模态模型在建筑图纸理解上的能力,发现OCR和文本问答表现最佳,但符号理解尤其是门窗计数仍存在较大误差,需改进领域特定表示和人机协作流程。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.04794 2026-01-09 cs.AI 57%

APEX: Academic Poster Editing Agentic Expert

APEX:学术海报编辑智能专家

Chengxin Shi, Qinnan Cai, Zeyuan Chen, Long Zeng, Yibo Zhao, Jing Yu, Jianxiang Yu, Xiang Li

机构 * School of Data Science and Engineering, East China Normal University(数据科学与工程学院,东华大学)

专题命中 文档图表理解 :VLM(abstract);分类 cs.AI

AI总结 APEX是首个交互式学术海报编辑框架,通过多级API和审查机制实现细粒度控制,并引入首个系统性基准APEX-Bench评估编辑效果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.03993 2026-01-08 cs.CV 57%

PosterVerse: A Full-Workflow Framework for Commercial-Grade Poster Generation with HTML-Based Scalable Typography

PosterVerse: 一个用于商业级海报生成的全流程框架,基于HTML的可扩展字体

Junle Liu, Peirong Zhang, Yuyi Zhang, Pengyu Yan, Hui Zhou, Xinyue Zhou, Fengjun Guo, Lianwen Jin

专题命中 文档图表理解 :MLLM(abstract);分类 cs.CV

AI总结 PosterVerse通过全流程框架和HTML驱动技术,实现商业级海报的高密度文本渲染与灵活设计。

Journal ref AAAI 2026 Oral

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.02384 2026-01-07 cs.CV 57%

RxnCaption: Reformulating Reaction Diagram Parsing as Visual Prompt Guided Captioning

RxnCaption:将反应图解析重新表述为视觉提示引导的描述生成

Jiahe Song, Chuang Wang, Bowen Jiang, Yinfan Wang, Hao Zheng, Xingjian Wei, Chengjin Liu, Rui Nie, Junyuan Gao, Jiaxing Sun, Yubin Wang, Lijun Wu, Zhenhua Huang, Jiang Wu, Qian Yu, Conghui He

机构 * Shanghai AI Laboratory(上海人工智能实验室) Shanghai Jiao Tong University(上海交通大学) Beihang University(北航) Peking University(北京大学) South China Normal University(华南师范大学) Northwestern Polytechnical University(西北工业大学)

专题命中 文档图表理解 :vision language model(abstract);分类 cs.CV

AI总结 RxnCaption通过将反应图解析转化为视觉提示引导的描述生成任务,提升化学反应数据的机器可读性,并构建大规模数据集推动AI在化学领域的应用。

详情

展开后加载摘要…

URL PDF HTML 收藏