Toward Modality Gap: Vision Prototype Learning for Weakly-supervised Semantic Segmentation with CLIP
专题命中 图文多模态 :cross-modal(abstract);分类 cs.CV
AI 大模型
跨文本、图像、视频、音频等模态的大模型与学习方法。
专题命中 图文多模态 :cross-modal(abstract);分类 cs.CV
专题命中 图文多模态 :cross-modal(abstract);分类 cs.CV
Comments Accepted by T-IP. A PyTorch re-implementation is at https://github.com/VamosC/CLIP4STR (Credit on GitHub@VamosC)
专题命中 图文多模态 :multimodal(abstract);分类 cs.CV
专题命中 图文多模态 :multi-modal(abstract);分类 cs.CV
Comments update author
专题命中 图文多模态 :image-text(abstract);分类 cs.CV
Comments Equal contribution: Chao Pang, Xingxing Weng, Jiang Wu; Corresponding author: Gui-Song Xia, Conghui He
专题命中 图文多模态 :multi-modal(abstract);分类 cs.AI
专题命中 图文多模态 :image-text(abstract);分类 cs.CV
专题命中 图文多模态 :image-text(abstract);分类 cs.CV
Comments Accepted by AAAI 2025
专题命中 图文多模态 :multimodal(abstract);分类 cs.CV
Comments 11 pages, 9 figures
专题命中 图文多模态 :multi-modal(abstract);分类 cs.CV
Comments 17 pages. Work done during 2023 summer and has been released
专题命中 图文多模态 :image-text(abstract);分类 cs.CV
Comments Disclaimer: This work is part of a course project and reflects ongoing exploration in the field of vision-language models and calorie estimation. Findings and conclusions are subject to further validation and refinement
专题命中 图文多模态 :multimodal(abstract);分类 cs.CV
专题命中 图文多模态 :multi-modal(abstract);分类 cs.AI
专题命中 图文多模态 :cross-modal(abstract);分类 cs.CV
专题命中 图文多模态 :multimodal(abstract);分类 cs.CV
专题命中 图文多模态 :multimodal(abstract);分类 cs.CV
专题命中 图文多模态 :image-text(abstract);分类 cs.CV
专题命中 图文多模态 :multi-modal(abstract);分类 cs.CV
专题命中 图文多模态 :image-text(abstract);分类 cs.CV
Comments 13 pages, 10 figures
专题命中 图文多模态 :multimodal(abstract);分类 cs.AI
专题命中 图文多模态 :image-text(abstract);分类 cs.CV
Comments WACV 2025
专题命中 图文多模态 :image-text(abstract);分类 cs.CV
Comments 15 pages, 15 figures
专题命中 图文多模态 :multimodal(abstract);分类 cs.CV
专题命中 图文多模态 :multimodal(abstract);分类 cs.CV
Comments 8 pages, 13 tables, 2 figures
专题命中 图文多模态 :multi-modal(abstract);分类 cs.CV
专题命中 图文多模态 :multimodal(abstract);分类 cs.CV
Comments NeurIPS 2024; Project page: https://thaoshibe.github.io/YoLLaVA
专题命中 图文多模态 :multimodal(abstract);分类 cs.CV
专题命中 图文多模态 :image-text(abstract);分类 cs.CV
Comments Accepted to NeurIPS2024
专题命中 图文多模态 :image-text(abstract);分类 cs.CV
Comments Webpage: https://histodiffusion.github.io/docs/publications/gensis
专题命中 图文多模态 :multi-modal(abstract);分类 cs.CV