arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

视觉大模型 / VLM

视觉语言模型、视觉推理、视觉问答、图文理解和视觉 grounding。

2026-08-25 至 2026-08-25 共收录 12 信号源:cs.CV, cs.AI, cs.LG

1. 文档图表理解 12 篇

2608.22366 2026-08-25 cs.CV 新提交 84%

When Do VLMs Help Arabic Manuscript OCR? A Cross-Dataset Study

视觉语言模型(VLMs)何时助力阿拉伯手稿光学字符识别(OCR)?一项跨数据集研究

Moshiur Farazi, Firoj Alam, Abderrahmane Maaradji, Zakaria Maamar, Hamdy Mubarak, Wajdi Zaghouani

机构 * Qatar Computing Research Institute(卡塔尔计算研究所) Hamad Bin Khalifa University(哈马德·本·哈利法大学) Northwestern University in Qatar(卡塔尔西北大学) University of Doha for Science Technology(多哈科技大学)

专题命中 文档图表理解 :VLM(summary_cn,abstract);vision-language model(abstract);分类 cs.CV

AI总结 本文通过跨8类阿拉伯语文本数据集的实验,探究VLMs对阿拉伯手稿OCR的助力场景,提出OCR先验可恢复性原则,支持构建自适应OCR-VLM工作流。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.22754 2026-08-25 cs.CV cs.AI 版本更新 81%

Procedural Knowledge Extraction from Industrial Troubleshooting Guides Using Vision Language Models

从工业故障排除指南中提取程序性知识:使用视觉语言模型

Guillermo Gil de Avalle, Laura Maruster, Christos Emmanouilidis

机构 * University of Groningen(Groningen大学)

专题命中 文档图表理解 :vision language model(title,abstract);分类 cs.CV、cs.AI

AI总结 本文研究如何利用视觉语言模型从工业故障排除指南中提取结构化知识,通过对比两种提示策略评估模型性能,揭示布局敏感性与语义稳健性的权衡。

Comments Accepted to the 23rd IFAC World Congress (IFAC 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.22724 2026-08-25 cs.CE 新提交 80%

Frontiers in FinTech: Multimodal Foundation Models for Financial Reporting and Decision Science

金融科技前沿:面向财务报告与决策科学的多模态基础模型

Yulu Huang, Niannian Yu, Yaxin Yang, Yong Huang

专题命中 文档图表理解 :MLLM(abstract,abstract_cn);vision-language model(abstract);multimodal large language model(abstract)

AI总结 针对异构财务数据对会计信息系统的挑战,本研究提出多模态大语言模型FinVision,经200家上市公司验证可降低19%估值误差,48名专业用户测试缩短51%任务时间,助力审计自动化与财务分析民主化。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.22316 2026-08-25 cs.LG cs.CV 新提交 73%

Does a Modern-Handwriting Warm-Up Help Historical Arabic OCR? A Reproducible, Compute-Matched Evaluation on Muharaf and KHATT

现代手写体热身是否有助于历史阿拉伯文OCR?针对Muharaf和KHATT的可复现、计算匹配评估

Sumaih Almarshad, Maram Alamri, Dona Aloraini, Fares Altuwaim, AlJawharh AlOtaibi, Reem Alyabis, Rayah Aldawsari

机构 * Dal Research Team(达尔研究团队)

专题命中 文档图表理解 :VLM(abstract,abstract_cn);分类 cs.CV、cs.LG

AI总结 本研究通过可复现、计算匹配的实验评估现代手写体热身对历史阿拉伯文OCR的影响,发现其并非普遍有效,发布了可独立验证的SaudiHeritage-OCR包。

Comments 14 pages, Dal Research Team

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.09874 2026-08-25 cs.CV cs.AI cs.IR 版本更新 62%

Benchmarking Document Parsers on Mathematical Formula Extraction from PDFs

对PDF中数学公式提取的文档解析器进行基准测试

Pius Horn, Janis Keuper

机构 * Institute for Machine Learning and Analytics (IMLA), Offenburg University, Offenburg, Germany(机器学习与分析研究所(IMLA)、奥芬堡大学) University of Mannheim, Mannheim, Germany(曼海姆大学)

专题命中 文档图表理解 :vision-language model(abstract);分类 cs.CV、cs.AI

AI总结 本文提出了一种新的PDF数学公式提取基准测试框架,通过合成数据和LLM评估方法,评估了多种解析器的性能差异,揭示了选择合适解析器的关键因素。

Comments Best Scientific Paper Award, ICPR 2026 (Document Analysis and Recognition Track)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.22842 2026-08-25 cs.AI 新提交 57%

FinixDoc: Rethinking Financial Document Parsing Beyond Saturated Benchmarks

FinixDoc:重新思考超出饱和基准的金融文档解析

Hang Wang, Jin Zhang, Guoliang Xu, Pengyue Lu, Yao Li, Zijiao Zhang, Tianyu Huang, Weiqi Xiong, Yulong Wang, Chuqiao Lu, Wenkang Huang, Kai Yang, Yadong Li, Hui Li, Xingzhong Xu, Xiao Xu

机构 * Ant Group(蚂蚁集团)

专题命中 文档图表理解 :vision-language model(abstract);分类 cs.AI

AI总结 本研究针对金融文档解析基准与实际需求的差距,提出端到端智能体解析系统FinixDoc,核心为4B规模视觉语言模型FinixDoc-VL,在自建评估套件FinixDocBench上实现最优性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.22214 2026-08-25 cs.AI cs.MM 新提交 57%

Query-Driven Multimodal Information Extraction from Long Documents

面向长文档的查询驱动多模态信息抽取

Yikai Gao, Ding Xia, Xi Yang

机构 * School of Artificial Intelligence, Jilin University(吉林大学人工智能学院) Graduate School of Information Science and Technology, The University of Tokyo(东京大学信息科学与技术研究生院)

专题命中 文档图表理解 :vision-language model(abstract);分类 cs.AI

AI总结 针对现有多模态长文档信息抽取范式的不足,本文提出查询驱动的图像-文本联合抽取任务,构建基准ITJoint并设计多智能体框架Q2IT,实验显示Q2IT性能显著优于独立VLMs但仍有提升空间。

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.18484 2026-08-25 cs.CV cs.CL 版本更新 57%

Benchmarking and Boosting Multilingual Capabilities of LVLMs via OCR-Centric Reinforcement Learning

PM4Bench: 通过平行多语言多模态多任务语料库对大型视觉-语言模型进行基准测试

Junyuan Gao, Jiahe Song, Jiang Wu, Runchuan Zhu, Guanlin Shen, Shasha Wang, Xingjian Wei, Haote Yang, Weijia Li, Bin Wang, Lijun Wu, Conghui He

机构 * Shanghai Artificial Intelligence Laboratory(上海人工智能实验室) Shanghai Jiao Tong University(上海交通大学) Peking University(北京大学) Sun Yat-Sen University(中山大学) Chinese University of Hong Kong(香港中文大学)

专题命中 文档图表理解 :vision-language model(abstract);分类 cs.CV

AI总结 PM4Bench通过平行多语言多模态多任务语料库评估大型视觉-语言模型,揭示跨语言性能差异与OCR能力的关系。

Comments Accepted by EMNLP 2026 Main Conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.04529 2026-08-25 cs.AI 版本更新 57%

SlideGen: Collaborative Multimodal Agents for Scientific Slide Generation

SlideGen:用于科学幻灯片生成的协作多模态智能体

Xin Liang, Zhilin Zhang, Xiang Zhang, Haoran Su, Yiwei Xu, Siqi Sun, Chenyu You

机构 * Stony Brook University(石溪大学) University of British Columbia(不列颠哥伦比亚大学) University of California, Los Angeles(加州大学洛杉矶分校) Fudan University(复旦大学)

专题命中 文档图表理解 :grounding(abstract);分类 cs.AI

AI总结 SlideGen通过协作多模态智能体实现科学论文到高质量幻灯片的生成,提升视觉质量和内容忠实度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.00391 2026-08-25 cs.CV 版本更新 57%

VinciCoder: Unifying Multimodal Code Generation via Coarse-to-fine Visual Reinforcement Learning

VinciCoder:通过粗到细的视觉强化学习统一多模态代码生成

Xuanle Zhao, Deyang Jiang, Zhixiong Zeng, Lei Chen, Haoyue Yang, Haibo Qiu, Jing Huang, Yufeng Zhong, Liming Zheng, Yilin Cao, Lin Ma

机构 * Meituan(美团)

专题命中 文档图表理解 :vision-language model(abstract);分类 cs.CV

AI总结 VinciCoder通过粗到细的视觉强化学习框架,统一多模态代码生成,实现最先进的性能,超越现有开源模型。

Comments Accepted by EMNLP 2026 Main

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.23176 2026-08-25 cs.IR 新提交 50%

Evaluating Modern RAG: Textual, Multimodal, Dense, and Late Interaction Pipelines

评估现代RAG:文本、多模态、密集型与后期交互管道

Emre Kuru, Mehmet Onur Keskin

专题命中 文档图表理解 :vision-language model(abstract)

AI总结 该研究针对传统RAG在含视觉元素文档上的局限,提出数据驱动的RAG管道选择方法,评估了文本、多模态等现代RAG管道的性能与效率权衡,为实际应用提供指导。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.22081 2026-08-25 cs.SE cs.CL cs.IR 新提交 50%

W-RAG: Source-Aware Retrieval for Enterprise Document Generation from Heterogeneous Knowledge Bases

W-RAG:面向异构知识库的企业文档生成的源感知检索方法

Hridya Dhulipala, Rajesh Ombase, Michael Wang, Tien N. Nguyen

专题命中 文档图表理解 :grounding(abstract)

AI总结 针对异构知识库下企业文档生成中全局排序导致的上下文失衡问题,提出源感知检索框架W-RAG,引入相关数据集并验证其可提升文档覆盖率与生成质量。

Comments 18 pages

详情

展开后加载摘要…

URL PDF HTML 收藏