arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

视觉大模型 / VLM

视觉语言模型、视觉推理、视觉问答、图文理解和视觉 grounding。

2025-12-23 至 2025-12-23 共收录 2 信号源:cs.CV, cs.AI, cs.LG

1. 文档图表理解 2 篇

2512.18004 2025-12-23 cs.CV cs.AI cs.CL cs.LG 78%

Seeing Justice Clearly: Handwritten Legal Document Translation with OCR and Vision-Language Models

清晰地看见正义:结合OCR和视觉-语言模型的 handwritten 法律文件翻译

Shubham Kumar Nigam, Parjanya Aditya Shukla, Noel Shallum, Arnab Bhattacharya

专题命中 文档图表理解 :vision-language model(title);分类 cs.CV、cs.AI、cs.LG

AI总结 本文提出利用视觉大语言模型统一OCR与机器翻译流程,以提升低资源环境下手写法律文件的翻译效率和准确性。

Comments Accepted in AILaw @ AAAI 2026 Conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.19675 2025-12-23 econ.GN cs.CV cs.DL q-fin.EC 57%

Multimodal LLMs for Historical Dataset Construction from Archival Image Scans: German Patents (1877-1918)

多模态大语言模型用于从档案图像扫描中构建历史数据集:德国专利(1877-1918)

Niclas Griesshaber, Jochen Streb

机构 * University of Mannheim(曼海姆大学)

专题命中 文档图表理解 :multimodal large language model(abstract);分类 cs.CV

AI总结 本文提出利用多模态大语言模型构建德国1877-1918年专利数据集,证明其在效率和质量上的优势,并开源相关工具和数据以促进经济史研究。

详情

展开后加载摘要…

URL PDF HTML 收藏