arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

视觉大模型 / VLM

视觉语言模型、视觉推理、视觉问答、图文理解和视觉 grounding。

2025-08-20 至 2025-08-20 共收录 3 信号源:cs.CV, cs.AI, cs.LG

1. 其他VLM 3 篇

2503.12530 2025-08-20 cs.CL 78%

Basic Category Usage in Vision Language Models

Hunter Sawyer, Jesse Roberts, Kyle Moore

机构 * Computer Science, Tennessee Tech University(田纳西科技大学计算机科学系) Computer Science, Vanderbilt University(范德比大学计算机科学系)

专题命中 其他VLM :vision language model(title);vision-language model(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.13713 2025-08-20 cs.CV 57%

Hierarchical Vision-Language Retrieval of Educational Metaverse Content in Agriculture

Ali Abdari, Alex Falcon, Giuseppe Serra

机构 * University of Udine(乌迪大学) University of Naples Federico II(那不勒斯费德里科二世大学)

专题命中 其他VLM :vision-language model(abstract);分类 cs.CV

Comments Accepted for publication at the 23rd International Conference on Image Analysis and Processing (ICIAP 2025)

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.22884 2025-08-20 cs.CV 57%

AutoComPose: Automatic Generation of Pose Transition Descriptions for Composed Pose Retrieval Using Multimodal LLMs

Yi-Ting Shen, Sungmin Eum, Doheon Lee, Rohit Shete, Chiao-Yi Wang, Heesung Kwon, Shuvra S. Bhattacharyya

机构 * University of Maryland, College Park(马里兰大学学院市分校) DEVCOM Army Research Laboratory(陆军研究实验室)

专题命中 其他VLM :multimodal large language model(abstract);分类 cs.CV

Comments ICCV 2025

详情

展开后加载摘要…

URL PDF HTML 收藏