arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

视觉大模型 / VLM

视觉语言模型、视觉推理、视觉问答、图文理解和视觉 grounding。

2025-10-29 至 2025-10-29 共收录 34 信号源:cs.CV, cs.AI, cs.LG

1. VLM训练与架构 3 篇

2510.24214 2025-10-29 cs.CV 70%

SCOPE: Saliency-Coverage Oriented Token Pruning for Efficient Multimodel LLMs

Jinhong Deng, Wen Li, Joey Tianyi Zhou, Yang He

机构 * University of Electronic Science and Technology of China(电子科技大学) Shenzhen Institute for Advanced Study(深圳先进研究 institute) CFAR, Agency for Science, Technology and Research (A*STAR)(科技研究局(A*STAR)认知与人工智能研究中心) IHPC, Agency for Science, Technology and Research (A*STAR)(科技研究局(A*STAR)人工智能中心)

专题命中 VLM训练与架构 :LLaVA(abstract);multimodal large language model(abstract);分类 cs.CV

Comments NeurIPS 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.24424 2025-10-29 cs.LG cs.CV 62%

Advancing Compositional Awareness in CLIP with Efficient Fine-Tuning

Amit Peleg, Naman Deep Singh, Matthias Hein

机构 * Tübingen AI Center, University of Tübingen(图宾根人工智能中心,图宾根大学)

专题命中 VLM训练与架构 :vision-language model(abstract);分类 cs.CV、cs.LG

Comments Accepted at NeurIPS 2025

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 其他VLM 2 篇

2510.24242 2025-10-29 cs.NI cs.AI cs.LG 81%

Enabling Near-realtime Remote Sensing via Satellite-Ground Collaboration of Large Vision-Language Models

Zihan Li, Jiahao Yang, Yuxin Zhang, Zhe Chen, Yue Gao

机构 * Fudan University(复旦大学)

专题命中 其他VLM :vision-language model(title,abstract);分类 cs.AI、cs.LG

Comments 15 pages, 11 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.24321 2025-10-29 cs.CV cs.AI 62%

Few-Shot Remote Sensing Image Scene Classification with CLIP and Prompt Learning

Ivica Dimitrovski, Vlatko Spasev, Ivan Kitanovski

机构 * Faculty of Computer Science and Engineering(计算机科学与工程学院) University Ss Cyril and Methodius(西里尔与美多西乌斯大学)

专题命中 其他VLM :vision-language model(abstract);分类 cs.CV、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏