arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

视觉大模型 / VLM

视觉语言模型、视觉推理、视觉问答、图文理解和视觉 grounding。

2025-11-18 至 2025-11-18 共收录 3 信号源:cs.CV, cs.AI, cs.LG

1. 文档图表理解 3 篇

2511.13478 2025-11-18 cs.CV cs.AI cs.LG 85%

Semantic Document Derendering: SVG Reconstruction via Vision-Language Modeling

Adam Hazimeh, Ke Wang, Mark Collier, Gilles Baechler, Efi Kokiopoulou, Pascal Frossard

专题命中 文档图表理解 :vision-language model(title,abstract);VLM(abstract);分类 cs.CV、cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.13283 2025-11-18 cs.CV 70%

TabFlash: Efficient Table Understanding with Progressive Question Conditioning and Token Focusing

Jongha Kim, Minseong Bae, Sanghyeok Lee, Jinsung Yoon, Hyunwoo J. Kim

机构 * Korea University(韩国大学)

专题命中 文档图表理解 :multimodal large language model(abstract);MLLM(abstract);分类 cs.CV

Comments AAAI 2026 (Main Technical Track)

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.12978 2025-11-18 cs.CV 57%

Concept Regions Matter: Benchmarking CLIP with a New Cluster-Importance Approach

Aishwarya Agarwal, Srikrishna Karanam, Vineet Gandhi

机构 * CVIT, Kohli Centre for Intelligent Systems, IIIT Hyderabad(IIIT海得拉尔计算机视觉研究所、Kohli智能系统中心) Adobe Research, Bengaluru(Adobe研究)

专题命中 文档图表理解 :vision-language model(abstract);分类 cs.CV

Comments 25 pages, 21 figures

详情

展开后加载摘要…

URL PDF HTML 收藏