arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

视觉大模型 / VLM

视觉语言模型、视觉推理、视觉问答、图文理解和视觉 grounding。

2025-09-11 至 2025-09-11 共收录 6 信号源:cs.CV, cs.AI, cs.LG

1. 视觉推理 6 篇

2409.03521 2025-09-11 cs.CV 83%

Have Large Vision-Language Models Mastered Art History?

Ombretta Strafforello, Derya Soydaner, Michiel Willems, Anne-Sofie Maerten, Stefanie De Winter

机构 * KU Leuven(库勒韦恩大学) Leiden University(莱顿大学)

专题命中 视觉推理 :vision-language model(title,abstract);LLaVA(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.08270 2025-09-11 cs.LG cs.AI 81%

Interpretable Physics Reasoning and Performance Taxonomy in Vision-Language Models

Pranav Pawar, Kavish Shah, Akshat Bhalani, Komal Kasat, Dev Mittal, Hadi Gala, Deepali Patil, Nikita Raichada, Monali Deshmukh

专题命中 视觉推理 :vision-language model(title,abstract);分类 cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.08126 2025-09-11 cs.RO 78%

Attribute-based Object Grounding and Robot Grasp Detection with Spatial Reasoning

Houjian Yu, Zheming Zhou, Min Sun, Omid Ghasemalizadeh, Yuyin Sun, Cheng-Hao Kuo, Arnie Sen, Changhyun Choi

机构 * Department of Electrical and Computer Engineering, Univ. of Minnesota(电气与计算机工程系) Amazon Lab126(亚马逊实验室126) National Tsing Hua University(国立清华大学)

专题命中 视觉推理 :grounding(title,abstract)

Comments Accepted to 2025 IEEE-RAS 24th International Conference on Humanoid Robots

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.15108 2025-09-11 cs.LG cs.AI cs.RO 73%

VIPER: Visual Perception and Explainable Reasoning for Sequential Decision-Making

Mohamed Salim Aissi, Clemence Grislain, Mohamed Chetouani, Olivier Sigaud, Laure Soulier, Nicolas Thome

机构 * Sorbonne Université, CNRS, ISIR(索邦大学、国家科学研究中心、ISIR)

专题命中 视觉推理 :vision-language model(abstract);VLM(abstract);分类 cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.16654 2025-09-11 cs.CV 57%

MSNav: Zero-Shot Vision-and-Language Navigation with Dynamic Memory and LLM Spatial Reasoning

Chenghao Liu, Zhimu Zhou, Jiachen Zhang, Minghao Zhang, Songfang Huang, Huiling Duan

专题命中 视觉推理 :grounding(abstract);分类 cs.CV

Comments 9 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.14581 2025-09-11 cs.MM eess.IV 50%

Memory-Anchored Multimodal Reasoning for Explainable Video Forensics

Chen Chen, Runze Li, Zejun Zhang, Pukun Zhao, Fanqing Zhou, Longxiang Wang, Haojian Huang

专题命中 视觉推理 :grounding(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏