arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

视觉大模型 / VLM

视觉语言模型、视觉推理、视觉问答、图文理解和视觉 grounding。

2026-09-01 至 2026-09-01 共收录 3 信号源:cs.CV, cs.AI, cs.LG

1. 文档图表理解 3 篇

2608.28698 2026-09-01 cs.CV 新提交 89%

State-Conditioned Visual Evidence Retrieval for Fine-Grained Perception in Document Vision-Language Models

面向文档视觉语言模型中细粒度感知的状态条件视觉证据检索

Mingxu Chai, Chenyu Liu, Ziyu Shen, Jiazheng Zhang, Kaidi Zhang, Ruoyu Chen, Jun Long, Jihua Kang, Tao Gui, Qi Zhang

机构 * College of Computer Science and Artificial Intelligence, Fudan University(复旦大学计算机科学与人工智能学院) Shanghai Innovation Institute(上海创新研究院) Shanghai Artificial Intelligence Laboratory(上海人工智能实验室) ByteDance, LarkAI(字节跳动 LarkAI) Shanghai Key Lab of Intelligent Information Processing(上海智能信息处理重点实验室)

专题命中 文档图表理解 :VLM(summary_cn,abstract);vision-language model(title,abstract);分类 cs.CV

AI总结 针对现有VLM文档解析方法效率低的问题,提出SCVER方法,通过状态条件检索高分辨率区域,结合SGLO稳定训练,提升了低输入分辨率下的鲁棒性与准确率-效率权衡。

Comments 18 pages, 12 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.28784 2026-09-01 cs.CV 新提交 57%

ClearText-Video: A Large-Scale Text-Centric Video Dataset Bridging Video Restoration and Scene-Text Enhancement

ClearText-Video:连接视频修复与场景文本增强的大规模以文本为中心的视频数据集

Jinlong Li, Jiaming Ding, Dingfu Lu, Malcolm Hsiu, Chuang Ke, Kangning Yang, Bochen Guan, Lan Fu, Jie Cai, Huiming Sun, Zibo Meng

机构 * OPPO US AI Center(OPPO美国人工智能中心) University of Wisconsin–Madison(威斯康星大学麦迪逊分校) University of California San Diego(加利福尼亚大学圣迭戈分校)

专题命中 文档图表理解 :multimodal large language model(abstract);分类 cs.CV

AI总结 研究团队推出ClearText-Video数据集,评估发现视觉增强未必提升文本推理,仅OCR管道远逊于多模态推理,为相关系统提供基础。

Comments This paper is accepted by 2026 Proceedings of the European Conference on Computer Vision

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.30678 2026-09-01 cs.CL 新提交 50%

OCR-MetaReasoning Benchmark: Evaluating the Meta-Reasoning Ability of MLLMs in Text-Rich Image Understanding

OCR元推理基准:评估多模态大语言模型在富文本图像理解中的元推理能力

Gengxu Li, Yuan Wu, Yi Chang

机构 * School of Artificial Intelligence, Jilin University(吉林大学人工智能学院) International Center of Future Science, Jilin University(吉林大学未来科学国际中心)

专题命中 文档图表理解 :multimodal large language model(abstract)

AI总结 本文提出OCR-MetaReasoning基准,将演绎、归纳、溯因作为不同推理方向,分离答案正确性与推理合规性,实验发现现有MLLMs的OCR元推理能力远未饱和。

Comments EMNLP 2026 Findings camera-ready version

详情

展开后加载摘要…

URL PDF HTML 收藏