arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

视觉大模型 / VLM

视觉语言模型、视觉推理、视觉问答、图文理解和视觉 grounding。

2025-09-15 至 2025-09-15 共收录 4 信号源:cs.CV, cs.AI, cs.LG

1. 视觉推理 4 篇

2509.09732 2025-09-15 cs.CV 70%

Decomposing Visual Classification: Assessing Tree-Based Reasoning in VLMs

Sary Elmansoury, Islam Mesabah, Gerrit Großmann, Peter Neigel, Raj Bhalwankar, Daniel Kondermann, Sebastian J. Vollmer

专题命中 视觉推理 :vision language model(abstract);VLM(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.10059 2025-09-15 cs.CV cs.AI 62%

Multimodal Mathematical Reasoning Embedded in Aerial Vehicle Imagery: Benchmarking, Analysis, and Exploration

Yue Zhou, Litong Feng, Mengcheng Lan, Xue Yang, Qingyun Li, Yiping Ke, Xue Jiang, Wayne Zhang

机构 * Department of Physics, J.K. Institute of Science(J.K.科学研究院物理系) World Scientific University(世界科学大学) University of Intelligent Studies(智能研究大学) East China Normal University(华东师范大学) Nanyang Technological University(南洋理工大学) SenseTime Research(商汤科技研究院) Shanghai Jiao Tong University(上海交通大学) Harbin Institute of Technology(哈尔滨工业大学)

专题命中 视觉推理 :vision-language model(abstract);分类 cs.CV、cs.AI

Comments 17 pages, 16 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.09730 2025-09-15 cs.CV cs.AI 62%

MITS: A Large-Scale Multimodal Benchmark Dataset for Intelligent Traffic Surveillance

Kaikai Zhao, Zhaoxiang Liu, Peng Wang, Xin Wang, Zhicheng Ma, Yajun Xu, Wenjing Zhang, Yibing Nan, Kai Wang, Shiguo Lian

机构 * organization= Data Science \& Artificial Intelligence Research Institute, China Unicom , city= Beijing , postcode= 100033 , country= PR China

专题命中 视觉推理 :LLaVA(abstract);分类 cs.CV、cs.AI

Comments accepted by Image and Vision Computing

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.09790 2025-09-15 cs.AI 57%

How well can LLMs provide planning feedback in grounded environments?

Yuxuan Li, Victor Zhong

机构 * David R. Cheriton School of Computer Science University of Waterloo(大卫·R·切里顿计算机科学学院滑铁卢大学)

专题命中 视觉推理 :vision language model(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏