arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

视觉大模型 / VLM

视觉语言模型、视觉推理、视觉问答、图文理解和视觉 grounding。

2025-08-19 至 2025-08-19 共收录 12 信号源:cs.CV, cs.AI, cs.LG

1. 视觉推理 12 篇

2508.12400 2025-08-19 cs.CV 89%

MPCAR: Multi-Perspective Contextual Augmentation for Enhanced Visual Reasoning in Large Vision-Language Models

Amirul Rahman, Qiang Xu, Xueying Huang

机构 * University of Malaya(马来大学)

专题命中 视觉推理 :vision-language model(title,abstract);visual reasoning(title,abstract);visual question answering(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.12198 2025-08-19 physics.ao-ph cs.AI cs.LG 85%

Exploring Multimodal AI Reasoning for Meteorological Forecasting from Skew-T Diagrams

ChangJae Lee, Heecheol Yang, Jonghak Choi

专题命中 视觉推理 :vision-language model(abstract);VLM(abstract);visual reasoning(abstract);visual question answering(abstract)

Comments 24 pages, 3 figures, 9 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.12473 2025-08-19 cs.CV cs.AI 84%

Standardization of Neuromuscular Reflex Analysis -- Role of Fine-Tuned Vision-Language Model Consortium and OpenAI gpt-oss Reasoning LLM Enabled Decision Support System

Eranga Bandara, Ross Gore, Sachin Shetty, Ravi Mukkamala, Christopher Rhea, Atmaram Yarlagadda, Shaifali Kaushik, L. H. M. P. De Silva, Andriy Maznychenko, Inna Sokolowska, Amin Hass, Kasun De Zoysa

机构 * Old Dominion University(旧 Dominion 大学) AnaletIQ McDonald Army Health Center(麦克唐纳陆军医疗中心) University of Sri Jayewardenepura(Sri Jayewardenepura 大学) University of Gdańsk(盖尔范大学) University of Colombo(科伦坡大学)

专题命中 视觉推理 :vision-language model(title,abstract);VLM(abstract);分类 cs.CV、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.11918 2025-08-19 cs.RO 82%

ExploreVLM: Closed-Loop Robot Exploration Task Planning with Vision-Language Models

Zhichen Lou, Kechun Xu, Zhongxiang Zhou, Rong Xiong

机构 * State Key Laboratory of Industrial Control Technology(工业控制技术国家重点实验室) Institute of Cyber-Systems and Control(网络系统与控制研究所) Zhejiang University(浙江大学) Zhejiang Humanoid Robot Innovation Center Co., Ltd.(浙江人形机器人创新中心有限公司)

专题命中 视觉推理 :vision-language model(title,abstract);VLM(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.12109 2025-08-19 cs.CV cs.AI 79%

Simple o3: Towards Interleaved Vision-Language Reasoning

Ye Wang, Qianglong Chen, Zejun Li, Siyuan Wang, Shijie Guo, Zhirui Zhang, Zhongyu Wei

机构 * Independent Researcher(独立研究者)

专题命中 视觉推理 :visual reasoning(abstract);grounding(abstract);multimodal large language model(abstract);分类 cs.CV、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.06801 2025-08-19 cs.HC 78%

Understanding Pedestrian Gesture Misrecognition: Insights from Vision-Language Model Reasoning

Tram Thi Minh Tran, Xinyan Yu, Callum Parker, Julie Stephany Berrio Perez, Stewart Worrall, Martin Tomitsch

专题命中 视觉推理 :vision-language model(title,abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.12455 2025-08-19 cs.CV 74%

X-Ray-CoT: Interpretable Chest X-ray Diagnosis with Vision-Language Models via Chain-of-Thought Reasoning

Chee Ng, Liliang Sun, Shaoqing Tang

机构 * Universiti Teknologi Malaysia(马来西亚技术大学)

专题命中 视觉推理 :vision-language model(title);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.12680 2025-08-19 cs.CV cs.CL 70%

Vision-G1: Towards General Vision Language Reasoning with Multi-Domain Data Curation

Yuheng Zha, Kun Zhou, Yujia Wu, Yushu Wang, Jie Feng, Zhi Xu, Shibo Hao, Zhengzhong Liu, Eric P. Xing, Zhiting Hu

机构 * UC San Diego(UC圣地亚哥大学) Carnegie Mellon University(卡内基梅隆大学) MBZUAI(马斯克人工智能研究所)

专题命中 视觉推理 :VLM(abstract);visual reasoning(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.12916 2025-08-19 cs.RO 67%

RoboRetriever: Single-Camera Robot Object Retrieval via Active and Interactive Perception with Dynamic Scene Graph

Hecheng Wang, Jiankun Ren, Jia Yu, Lizhe Qi, Yunquan Sun

专题命中 视觉推理 :vision-language model(abstract);visual reasoning(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.10113 2025-08-19 cs.CV 57%

Interpretable Oracle Bone Script Decipherment through Radical and Pictographic Analysis with LVLMs

Kaixin Peng, Mengyang Zhao, Haiyang Yu, Teng Fu, Bin Li

专题命中 视觉推理 :vision-language model(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.11818 2025-08-19 cs.SD cs.LG 57%

Audio Flamingo Sound-CoT Technical Report: Improving Chain-of-Thought Reasoning in Sound Understanding

Zhifeng Kong, Arushi Goel, Joao Felipe Santos, Sreyan Ghosh, Rafael Valle, Wei Ping, Bryan Catanzaro

专题命中 视觉推理 :vision language model(abstract);分类 cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.14425 2025-08-19 cs.CL 50%

From Templates to Natural Language: Generalization Challenges in Instruction-Tuned LLMs for Spatial Reasoning

Chalamalasetti Kranti, Sherzod Hakimov, David Schlangen

机构 * Computational Linguistics, Department of Linguistics University of Potsdam(乌特雷赫特大学语言学系计算语言学部) German Research Center for Artificial Intelligence (DFKI), Berlin(德国人工智能研究中心(DFKI)柏林)

专题命中 视觉推理 :grounding(abstract)

Comments 17 pages

详情

展开后加载摘要…

URL PDF HTML 收藏