Explaining Similarity in Vision-Language Encoders with Weighted Banzhaf Interactions
机构 * University of Warsaw(华沙大学) ; Warsaw University of Technology(华沙理工大学) ; LMU Munich(慕尼黑大学) ; MCML ; DFKI(德累斯顿大学) ; Bielefeld University(比勒菲尔德大学)
专题命中 图文多模态 :multimodal(abstract);cross-modal(abstract);image-text(abstract);分类 cs.CV、cs.AI
Comments NeurIPS 2025. Code: https://github.com/hbaniecki/fixlip