FOCUS: Internal MLLM Representations for Efficient Fine-Grained Visual Question Answering
机构 * Technical University of Berlin(柏林技术大学) ; Technical University of Munich(慕尼黑技术大学) ; CARIAD SE ; Volkswagen AG(大众集团)
专题命中 图文多模态 :MLLM(title,abstract);multimodal(abstract);image-text(abstract);分类 cs.CV
Comments Accepted by NeurIPS 2025 - main track. Project page: https://focus-mllm-vqa.github.io/