arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

视觉大模型 / VLM

视觉语言模型、视觉推理、视觉问答、图文理解和视觉 grounding。

2025-09-10 至 2025-09-10 共收录 3 信号源:cs.CV, cs.AI, cs.LG

1. 视觉推理 3 篇

2412.01370 2025-09-10 cs.CV cs.CL 77%

Understanding Museum Exhibits using Vision-Language Reasoning

Ada-Astrid Balauca, Sanjana Garai, Stefan Balauca, Rasesh Udayakumar Shetty, Naitik Agrawal, Dhwanil Subhashbhai Shah, Yuqian Fu, Xi Wang, Kristina Toutanova, Danda Pani Paudel, Luc Van Gool

机构 * ETH Zürich, Switzerland(苏黎世联邦理工学院,瑞士) Indian Institute of Technology, Varanasi (IIT BHU)(印度瓦拉纳西理工学院(IIT BHU)) Google DeepMind(谷歌DeepMind)

专题命中 视觉推理 :vision-language model(abstract);LLaVA(abstract);visual question answering(abstract);分类 cs.CV

Comments Accepted at ICCV 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.17180 2025-09-10 cs.AI cs.CV cs.LG 67%

MaRVL-QA: A Benchmark for Mathematical Reasoning over Visual Landscapes

Nilay Pande, Sahiti Yerramilli, Jayant Sravan Tamarapalli, Rynaa Grover

机构 * Waymo Google(谷歌)

专题命中 视觉推理 :multimodal large language model(abstract);分类 cs.CV、cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.12312 2025-09-10 cs.CV cs.AI cs.CL cs.LG cs.RO 67%

Visuospatial Cognitive Assistant

Qi Feng

机构 * Kyoto University(京都大学)

专题命中 视觉推理 :vision-language model(abstract);分类 cs.CV、cs.AI、cs.LG

Comments 31 pages, 10 figures, 6 tables

详情

展开后加载摘要…

URL PDF HTML 收藏