ProCLIP: Progressive Vision-Language Alignment via LLM-based Embedder
通过基于大语言模型的嵌入器实现渐进式视觉-语言对齐的ProCLIP
机构 * Shanghai Jiao Tong University(上海交通大学) ; Beijing Institute of Technology(北京理工大学) ; DeepGlint(深图科技) ; Beijing University of Technology(北京工业大学) ; Tsinghua University(清华大学)
AI总结 ProCLIP通过课程学习逐步对齐CLIP图像编码器与基于大语言模型的嵌入器,提升长文本处理和多语言理解能力。
Comments 17 pages, 5 fiugres