arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

视觉大模型 / VLM

视觉语言模型、视觉推理、视觉问答、图文理解和视觉 grounding。

2025-09-10 至 2025-09-10 共收录 2 信号源:cs.CV, cs.AI, cs.LG

1. 文档图表理解 2 篇

2509.07473 2025-09-10 cs.AI 79%

SheetDesigner: MLLM-Powered Spreadsheet Layout Generation with Rule-Based and Vision-Based Reflection

Qin Chen, Yuanyi Ren, Xiaojun Ma, Mugeng Liu, Han Shi, Dongmei Zhang

机构 * Peking University(北京大学) Microsoft(微软)

专题命中 文档图表理解 :MLLM(title);multimodal large language model(abstract);分类 cs.AI

Comments Accepted to EMNLP 2025 Main Conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.07666 2025-09-10 cs.CL cs.IR 67%

MoLoRAG: Bootstrapping Document Understanding via Multi-modal Logic-aware Retrieval

Xixi Wu, Yanchao Tan, Nan Hou, Ruiyang Zhang, Hong Cheng

机构 * The Chinese University of Hong Kong(香港中文大学) Fuzhou University(福州大学) University of Macau(澳门大学)

专题命中 文档图表理解 :vision-language model(abstract);VLM(abstract)

Comments EMNLP Main 2025

详情

展开后加载摘要…

URL PDF HTML 收藏