Basic Category Usage in Vision Language Models
机构 * Computer Science, Tennessee Tech University(田纳西科技大学计算机科学系) ; Computer Science, Vanderbilt University(范德比大学计算机科学系)
专题命中 其他VLM :vision language model(title);vision-language model(abstract)
AI 大模型
视觉语言模型、视觉推理、视觉问答、图文理解和视觉 grounding。
机构 * Computer Science, Tennessee Tech University(田纳西科技大学计算机科学系) ; Computer Science, Vanderbilt University(范德比大学计算机科学系)
专题命中 其他VLM :vision language model(title);vision-language model(abstract)
机构 * University of Udine(乌迪大学) ; University of Naples Federico II(那不勒斯费德里科二世大学)
专题命中 其他VLM :vision-language model(abstract);分类 cs.CV
Comments Accepted for publication at the 23rd International Conference on Image Analysis and Processing (ICIAP 2025)
机构 * University of Maryland, College Park(马里兰大学学院市分校) ; DEVCOM Army Research Laboratory(陆军研究实验室)
专题命中 其他VLM :multimodal large language model(abstract);分类 cs.CV
Comments ICCV 2025