What matters when building vision-language models?
专题命中 图文多模态 :multimodal(abstract);分类 cs.CV、cs.AI
AI 大模型
跨文本、图像、视频、音频等模态的大模型与学习方法。
专题命中 图文多模态 :multimodal(abstract);分类 cs.CV、cs.AI
专题命中 图文多模态 :image-text(abstract);分类 cs.CV、cs.AI
Comments ICLR 2024 (spotlight). First two authors contributed equally. Code available at https://github.com/twke18/CAST
专题命中 图文多模态 :multimodal(abstract);分类 cs.CV、cs.MM
Comments 11 pages, 9 figures, 6 tables. For associated code, see https://anonymous.4open.science/r/Explore_FGVDs-E277
专题命中 图文多模态 :multimodal(abstract);分类 cs.CL、cs.AI
Journal ref KBC-LM workshop@ ISWC 2023
专题命中 图文多模态 :image-text(abstract);分类 cs.CV、cs.AI
Comments ICRA 2024
专题命中 图文多模态 :multimodal(abstract);分类 cs.CV、cs.AI
专题命中 图文多模态 :multi-modal(abstract);分类 cs.CV、cs.AI
专题命中 图文多模态 :image-text(abstract);分类 cs.CV、cs.AI
Comments Accepted to CVPR 2024. arXiv admin note: text overlap with arXiv:2310.02988
专题命中 图文多模态 :multimodal(abstract);分类 cs.CV、cs.AI
Comments 17 pages, 4 figures, 9 tables, 2 appendices
专题命中 图文多模态 :cross-modal(abstract);分类 cs.CV、cs.MM
专题命中 图文多模态 :multimodal(abstract);分类 cs.CV、cs.AI
专题命中 图文多模态 :multi-modal(abstract);分类 cs.CV、cs.CL
专题命中 图文多模态 :image-text(abstract);分类 cs.CV、cs.CL
Comments NAACL 2024 Main Conference
专题命中 图文多模态 :image-text(abstract);分类 cs.CV、cs.AI
专题命中 图文多模态 :multi-modal(abstract);分类 cs.CV、cs.AI
Comments Accepted by CVPR 2024
专题命中 图文多模态 :image-text(abstract);分类 cs.CV、cs.CL
Comments ICLR 2024
专题命中 图文多模态 :multimodal(abstract);分类 cs.CV、cs.CL
专题命中 图文多模态 :image-text(abstract);分类 cs.CV、cs.AI
Comments CV/ML
专题命中 图文多模态 :multi-modal(abstract);分类 cs.CV、cs.AI
Comments Accepted by AAAI 2023
专题命中 图文多模态 :multimodal(abstract);分类 cs.CV、cs.AI
Comments Accepted by CVPR 2024
专题命中 图文多模态 :multimodal(abstract);分类 cs.CV、cs.CL
Comments ICLR 2024
专题命中 图文多模态 :multimodal(abstract);分类 cs.CV、cs.AI
专题命中 图文多模态 :multi-modal(abstract);分类 cs.CV、cs.CL
Comments To appear in CVPR 2023
专题命中 图文多模态 :multimodal(abstract);分类 cs.CL、cs.AI
Comments ICRA 2024
专题命中 图文多模态 :multi-modal(abstract);分类 cs.CV、cs.CL
Comments 8 Pages, visual instruction tuning
专题命中 图文多模态 :cross-modal(abstract);分类 cs.CV、cs.CL
Comments 13 pages, 7 figures
专题命中 图文多模态 :multimodal(abstract);分类 cs.CV、cs.AI
Comments Accepted by AAAI 2024, Project Website: https://opendatalab.github.io/VIGC, Code and Pretrained Model: https://github.com/opendatalab/VIGC
专题命中 图文多模态 :multi-modal(abstract);分类 cs.CV、cs.CL
Comments Preprint
专题命中 图文多模态 :image-text(abstract);分类 cs.CV、cs.AI
Comments project page: https://linyq17.github.io/CLIP-Parrot-Bias/. Add more analysis and ablation studies. Update Figure 3 with a more precise metric
专题命中 图文多模态 :cross-modal(abstract);分类 cs.CV、cs.AI
Comments 17 pages,17 figures