Decoupled Visual Processing: Efficient Multimodal Adaptation via Modality-Specific Transformer Substitution
解耦视觉处理:通过模态特定Transformer替换实现高效多模态适配
机构 * Tsinghua University(清华大学) ; Beijing National Research Center for Information Science and Technology(北京信息科学与技术国家研究中心)
专题命中 指令微调 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);instruction tuning(abstract)
AI总结 该研究针对多模态大语言模型视觉指令微调成本高的问题,提出解耦视觉处理框架,替换预训练大语言模型上层解码器为轻量Transformer块,仅训练该块即可在多个基准上实现竞争力性能,降低了计算成本。