VisNec: Measuring and Leveraging Visual Necessity for Multimodal Instruction Tuning
VisNec: 衡量和利用视觉必要性进行多模态指令微调
机构 * SJTU(上海交通大学) ; Universiti Malaya(马来亚大学) ; CMU(卡内基梅隆大学) ; MBZUAI(穆萨台普大学人工智能研究所) ; KIT(卡尔斯鲁厄理工学院) ; KAUST(王国立阿联酋科学技术大学)
AI总结 提出VisNec分数衡量视觉输入在多模态指令微调中的边际贡献,结合语义聚类选择高必要性样本,在15%数据上达到全数据性能的100.2%。
Comments Accepted at ECCV 2026. Project Page: https://dmk041218.github.io/VisNec/