Interpretable Debiasing of Vision-Language Models for Social Fairness
可解释的视觉-语言模型社会公平性偏见消除
机构 * KAIST AI(韩国科学技术院人工智能研究所) ; University of Copenhagen(哥本哈根大学) ; NVIDIA(英伟达公司)
AI总结 本研究提出DeBiasLens框架,通过稀疏自编码器局部化VLM中的社会属性神经元,以可解释的方式消除模型中的社会偏见,同时保持语义知识。
Comments 25 pages, 30 figures, 13 Tables Accepted to CVPR 2026