arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

视觉大模型 / VLM

视觉语言模型、视觉推理、视觉问答、图文理解和视觉 grounding。

2026-01-12 至 2026-01-12 共收录 2 信号源:cs.CV, cs.AI, cs.LG

1. 文档图表理解 2 篇

2601.05688 2026-01-12 cs.CV 77%

SketchVL: Policy Optimization via Fine-Grained Credit Assignment for Chart Understanding and More

SketchVL:通过细粒度信用分配进行政策优化以实现图表理解和更多

Muye Huang, Lingling Zhang, Yifei Li, Yaqiang Wu, Jun Liu

机构 * School of Computer Science and Technology, Xi’an Jiaotong University, China(计算机科学与技术学院,西安交通大学) MOE KLINNS Lab, Xi’an Jiaotong University, China(教育部KLINNS实验室,西安交通大学) Zhongguancun Academy, Beijing, China(中关村学院,北京)

专题命中 文档图表理解 :visual reasoning(abstract);multimodal large language model(abstract);MLLM(abstract);分类 cs.CV

AI总结 SketchVL通过细粒度信用分配优化,提升多模态大语言模型在图表理解和多领域推理中的性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.10055 2026-01-12 cs.CV cs.AI 62%

PsOCR: Benchmarking Large Multimodal Models for Optical Character Recognition in Low-resource Pashto Language

PsOCR:用于低资源帕什托语言光学字符识别的大型多模态模型基准测试

Ijazul Haq, Yingjie Zhang, Irfan Ali Khan

机构 * organization= Shien-Ming Wu School of Intelligent Manufacturing, South China University of Technology , city= Guangzhou , postcode= 511442 , country= China organization= Artificial Intelligence Department, Guangdong CAS Angels Biotechnology Co. Ltd. , city= Foshan , country= China organization= Department of Software Engineering, Faculty of Electrical \& Computer Engineering, University of Engineering \& Technology , city= Peshawar , postcode= 25000 , country= Pakistan

专题命中 文档图表理解 :InternVL(abstract);分类 cs.CV、cs.AI

AI总结 PsOCR通过合成数据评估大型多模态模型在低资源帕什托语言OCR中的性能,发现Gemini表现最佳,Qwen-7B在开源模型中表现突出。

详情

展开后加载摘要…

URL PDF HTML 收藏