arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

视觉大模型 / VLM

视觉语言模型、视觉推理、视觉问答、图文理解和视觉 grounding。

2025-09-19 至 2025-09-19 共收录 7 信号源:cs.CV, cs.AI, cs.LG

1. 视觉推理 7 篇

2502.18042 2025-09-19 cs.CV cs.AI 84%

VLM-E2E: Enhancing End-to-End Autonomous Driving with Multimodal Driver Attention Fusion

Pei Liu, Haipeng Liu, Haichao Liu, Xin Liu, Jinxin Ni, Jun Ma

机构 * The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州)) Li Auto Inc.(Li汽车公司) the School of Aeronautics and Astronautics, Xiamen University(厦门大学航空航天学院) The Hong Kong University of Science and Technology(香港科技大学)

专题命中 视觉推理 :VLM(title,abstract);vision-language model(abstract);分类 cs.CV、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.15154 2025-09-19 cs.CV 70%

MedFact-R1: Towards Factual Medical Reasoning via Pseudo-Label Augmentation

Gengliang Li, Rongyu Chen, Bin Li, Linlin Yang, Guodong Ding

机构 * Baosight(博思特) NUS(新加坡国立大学) SIAT(深圳先进技术研究院) CUC(中国科学技术大学) Microsoft(微软) ANU(澳大利亚国立大学)

专题命中 视觉推理 :vision-language model(abstract);grounding(abstract);分类 cs.CV

Comments Tech report

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.15132 2025-09-19 cs.CY cs.CV 70%

From Pixels to Urban Policy-Intelligence: Recovering Legacy Effects of Redlining with a Multimodal LLM

Anthony Howell, Nancy Wu, Sharmistha Bagchi, Yushim Kim, Chayn Sun

专题命中 视觉推理 :multimodal large language model(abstract);MLLM(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.14746 2025-09-19 cs.CV cs.IR 70%

Chain-of-Thought Re-ranking for Image Retrieval Tasks

Shangrong Wu, Yanghong Zhou, Yang Chen, Feng Zhang, P. Y. Mok

专题命中 视觉推理 :multimodal large language model(abstract);MLLM(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.15217 2025-09-19 cs.AI cs.CV cs.LG 67%

Generalizable Geometric Image Caption Synthesis

Yue Xin, Wenyuan Wang, Rui Pan, Ruida Wang, Howard Meng, Renjie Pi, Shizhe Diao, Tong Zhang

机构 * University of Illinois Urbana-Champaign (UIUC)(伊利诺伊大学厄巴纳-香槟分校) Shanghai Jiao Tong University(上海交通大学) Rutgers University(罗格斯大学) NVIDIA

专题命中 视觉推理 :multimodal large language model(abstract);分类 cs.CV、cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.14666 2025-09-19 cs.SD cs.AI cs.CL 57%

Spatial Audio Motion Understanding and Reasoning

Arvind Krishna Sridhar, Yinyi Guo, Erik Visser

机构 * Qualcomm Technologies Inc.(高通技术公司)

专题命中 视觉推理 :grounding(abstract);分类 cs.AI

Comments 5 pages, 2 figures, 3 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.07917 2025-09-19 cs.RO 50%

MolmoAct: Action Reasoning Models that can Reason in Space

Jason Lee, Jiafei Duan, Haoquan Fang, Yuquan Deng, Shuo Liu, Boyang Li, Bohan Fang, Jieyu Zhang, Yi Ru Wang, Sangho Lee, Winson Han, Wilbert Pumacay, Angelica Wu, Rose Hendrix, Karen Farley, Eli VanderBilt, Ali Farhadi, Dieter Fox, Ranjay Krishna

机构 * Allen Institute for AI(艾伦人工智能研究所) University of Washington(华盛顿大学)

专题命中 视觉推理 :grounding(abstract)

Comments Updated GR00T result to N1.5

详情

展开后加载摘要…

URL PDF HTML 收藏