Beyond Visual Similarity: Entity-Aligned Retrieval for Knowledge-Based Visual Question Answering
超越视觉相似度:面向基于知识的视觉问答的实体对齐检索
机构 * Shenzhen International Graduate School, Tsinghua University(清华大学深圳国际研究生院) ; University of Arizona(亚利桑那大学)
专题命中 视觉问答 :MLLM(summary_cn,abstract);visual question answering(title,abstract);分类 cs.CV
AI总结 针对KB-VQA现有检索范式忽略实体语义对齐的缺陷,提出首个MLLM嵌入检索器KBMR,结合语义判别器与连续语义蒸馏目标,在Recall@1和VQA准确率上较CLIP基线实现显著提升。
Comments Accepted by ACM MM 2026