LLaVA-RE: Binary Image-Text Relevancy Evaluation with Multimodal Large Language Model
机构 * Stony Brook University(斯通布罗克大学) ; Amazon(亚马逊)
专题命中 多模态评测 :multimodal(title,abstract);image-text(title,abstract);MLLM(abstract);分类 cs.CV
Comments Published in the First Workshop of Evaluation of Multi-Modal Generation 2025