利用级联语义适配视觉基础模型
Adapting Vision Foundation Models with Cascaded Semantics
- University of Alabama at Birmingham(阿拉巴马大学伯明翰分校)
- Carnegie Mellon University(卡内基梅隆大学)
- University of Missouri–Kansas City(密苏里大学堪萨斯城分校)
- Northeastern University(东北大学)
- Tulane University(杜兰大学)
- University of Bristol(布里斯托大学)
- Oak Ridge National Laboratory(橡树岭国家实验室)
机构由 AI 辅助整理,请以论文原文为准。
AI总结:
该研究针对现有视觉提示调优(VPT)未利用先验知识的问题,提出向VPT注入两类语义先验的级联方案,在34个图像分类数据集上仅调优0.74%的ViT参数即实现优异下游适配效果。
AI中文摘要:
提示调优是自然语言处理(NLP)中一种领先的参数高效适配范式,近期已被扩展至计算机视觉领域。视觉提示调优(VPT)通过更新一小部分额外的提示参数来适配预训练视觉Transformer(ViT)。然而,现有视觉提示是随机初始化的,并未利用先验知识,例如NLP中的指令。我们通过向VPT中注入两种互补的语义先验来解决这一差距:包括颜色、纹理和形状在内的基础图像先验通过经典手工算子提取并注入输入空间,而自注意力图则在特征空间中提供实例感知语义。我们进一步提出一种级联方案,在整个ViT适配过程中整合这两种先验。在34个具有挑战性的图像分类数据集上进行的实验表明,该方法仅调优ViT 0.74%的参数即可实现优异的下游适配效果。项目页面:this https URL。
英文摘要:
Prompt tuning, a leading parameter-efficient adaptation paradigm in NLP, has recently been extended to computer vision. Visual prompt tuning (VPT) adapts pre-trained vision transformers (ViTs) by updating a small set of additional prompt parameters. However, existing visual prompts are randomly initialized and do not exploit prior knowledge, such as instructions in NLP. We address this gap by injecting two complementary semantic priors into VPT. Fundamental image priors, including color, texture, and shape, are extracted with classical hand-crafted operators and injected into the input space, while self-attention maps provide instance-aware semantics in the feature space. We further propose a cascaded scheme that integrates both priors throughout ViT adaptation. Experiments on 34 challenging image classification datasets demonstrate superior downstream adaptation while tuning only 0.74% of ViT parameters. Project page: https://xixiaouab.github.io/Cascaded-Semantics/.