arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

视觉大模型 / VLM

视觉语言模型、视觉推理、视觉问答、图文理解和视觉 grounding。

2025-08-18 至 2025-08-18 共收录 6 信号源:cs.CV, cs.AI, cs.LG

1. VLM训练与架构 6 篇

2508.00456 2025-08-18 eess.SP 89%

When Vision-Language Model (VLM) Meets Beam Prediction: A Multimodal Contrastive Learning Framework

Ji Wang, Bin Tang, Jian Xiao, Qimei Cui, Xingwang Li, Tony Q. S. Quek

专题命中 VLM训练与架构 :vision-language model(title,abstract);VLM(title,abstract);grounding(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.11317 2025-08-18 cs.CV cs.MM 83%

Logic Unseen: Revealing the Logical Blindspots of Vision-Language Models

Yuchen Zhou, Jiayu Tang, Shuo Yang, Xiaoyan Xiao, Yuqin Dai, Wenhao Yang, Chao Gou, Xiaobo Xia, Tat-Seng Chua

专题命中 VLM训练与架构 :vision-language model(title,abstract);VLM(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.11176 2025-08-18 cs.CV 79%

Fine-Grained VLM Fine-tuning via Latent Hierarchical Adapter Learning

Yumiao Zhao, Bo Jiang, Yuhe Ding, Xiao Wang, Jin Tang, Bin Luo

机构 * Information Materials and Intelligent Sensing Laboratory of Anhui Province(安徽省信息材料与智能感知实验室) Anhui Provincial Key Laboratory of Multimodal Cognitive Computation(安徽省多模态认知计算重点实验室) School of Computer Science and Technology, Anhui University(安徽大学计算机科学与技术学院)

专题命中 VLM训练与架构 :VLM(title);vision-language model(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.11170 2025-08-18 cs.CV cs.AI 73%

Better Supervised Fine-tuning for VQA: Integer-Only Loss

Baihong Qian, Haotian Fan, Wenjie Liao, Yunqiu Wang, Tao Li, Junhui Cui

机构 * ByteDance(字节跳动)

专题命中 VLM训练与架构 :vision language model(abstract);VLM(abstract);分类 cs.CV、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.09205 2025-08-18 eess.IV cs.AI cs.CV 73%

From Explainable to Explained AI: Ideas for Falsifying and Quantifying Explanations

Yoni Schirris, Eric Marcus, Jonas Teuwen, Hugo Horlings, Efstratios Gavves

机构 * Netherlands Cancer Institute University of Amsterdam(荷兰癌症研究所 阿姆斯特丹大学)

专题命中 VLM训练与架构 :vision-language model(abstract);VLM(abstract);分类 cs.CV、cs.AI

Comments 10 pages, 2 figures, 2 tables, submitted at MICCAI IMIMIC workshop

详情

展开后加载摘要…

URL PDF HTML 收藏
2311.14749 2025-08-18 cs.CV 70%

Compositional Zero-shot Learning via Progressive Language-based Observations

Lin Li, Guikun Chen, Zhen Wang, Jun Xiao, Long Chen

机构 * AI Chip Center for Emerging Smart Systems(新兴智能系统人工智能芯片中心) The Hong Kong University of Science(香港科学大学) Zhejiang University College of Computer Science(浙江大学计算机科学学院)

专题命中 VLM训练与架构 :vision-language model(abstract);VLM(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏