VLM2Vec-V2: Advancing Multimodal Embedding for Videos, Images, and Visual Documents
机构 * Salesforce Research(Salesforce研究机构) ; UC Santa Barbara(加州大学圣巴巴拉分校) ; University of Waterloo(滑铁卢大学) ; Tsinghua University(清华大学)
专题命中 跨模态检索 :multimodal(title,abstract);multi-modal(abstract);分类 cs.CV、cs.CL
Comments Technical Report