arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

视觉大模型 / VLM

视觉语言模型、视觉推理、视觉问答、图文理解和视觉 grounding。

2026-02-17 至 2026-02-17 共收录 3 信号源:cs.CV, cs.AI, cs.LG

1. 文档图表理解 3 篇

2602.14524 2026-02-17 cs.CV 79%

Error Patterns in Historical OCR: A Comparative Analysis of TrOCR and a Vision-Language Model

历史OCR中的错误模式:TrOCR与视觉语言模型的比较分析

Ari Vesalainen, Eetu Mäkelä, Laura Ruotsalainen, Mikko Tolonen

机构 * University of Helsinki, Department of Computer Science, Finland(赫尔辛基大学计算机科学系) University of Helsinki, Department of Digital Humanities, Finland(赫尔辛基大学数字人文系)

专题命中 文档图表理解 :vision-language model(title,abstract);分类 cs.CV

AI总结 本文比较了TrOCR与视觉语言模型在历史文本OCR中的表现,发现两者在错误模式和学术可靠性上存在显著差异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.13345 2026-02-17 cs.LG cs.IR cs.MA 57%

BLUEPRINT Rebuilding a Legacy: Multimodal Retrieval for Complex Engineering Drawings and Documents

BLUEPRINT 重筑遗产:面向复杂工程图纸和文档的多模态检索

Ethan Seefried, Ran Eldegaway, Sanjay Das, Nathaniel Blanchard, Tirthankar Ghosal

机构 * Oak Ridge National Laboratory(橡树岭国家实验室) Colorado State University(科罗拉多州立大学)

专题命中 文档图表理解 :VLM(abstract);分类 cs.LG

AI总结 Blueprint通过布局感知的多模态检索系统,提升对复杂工程图纸和文档的自动化检索能力,实现结构化元数据生成与跨设施搜索效率提升。

Comments 20 pages 8 main + 12 appendix + references

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.17315 2026-02-17 cs.CL 50%

HIPPO: Enhancing the Table Understanding Capability of LLMs through Hybrid-Modal Preference Optimization

HIPPO:通过混合模态偏好优化增强大语言模型的表格理解能力

Haolan Wang, Zhenghao Liu, Xinze Li, Xiaocui Yang, Yu Gu, Yukun Yan, Qi Shi, Fangfang Li, Chong Chen, Ge Yu

机构 * School of Computer Science and Engineering, Northeastern University, Shenyang, China(东北大学计算机科学与工程学院) Department of Computer Science and Technology, Tsinghua University, Beijing, China(清华大学计算机科学与技术系) Huawei Technologies Co., Ltd(华为技术有限公司)

专题命中 文档图表理解 :MLLM(abstract)

AI总结 HIPPO 通过混合模态偏好优化提升大语言模型的表格理解能力,实现 4% 的性能提升。

详情

展开后加载摘要…

URL PDF HTML 收藏