MME-VideoOCR: Evaluating OCR-Based Capabilities of Multimodal LLMs in Video Scenarios
MME-VideoOCR:评估多模态大语言模型在视频场景中基于OCR的能力
机构 * Kling Team(Kling团队) ; PKU(北京大学) ; THU(清华大学) ; CASIA(中国科学院自动化研究所) ; CUHKSZ(香港科技大学) ; NTU(国立台湾大学) ; NJU(南京大学) ; XJTU(吉林大学)
专题命中 文档图表理解 :multimodal large language model(abstract);分类 cs.CV
AI总结 本文推出MME-VideoOCR视频OCR基准,评估18个最先进MLLMs的视频OCR能力,发现现有模型在需视频整体理解的任务中表现有限,最优模型准确率仅73.7%,明确了高分辨率输入等对视频OCR的重要性。
Comments Accepted by NeurIPS 2025