DRScaffold: Boosting Dense-Scene Reasoning in Lightweight Vision Language Models
DRScaffold:提升轻量级视觉语言模型在密集场景推理中的能力
机构 * Shanghai Jiao Tong University(上海交通大学)
专题命中 视觉推理 :vision language model(title);vision-language model(abstract);VLM(abstract_cn);grounding(abstract)
AI总结 针对轻量级视觉语言模型在密集场景推理中缺乏显式视觉锚定导致推理链不可靠的问题,提出DRScaffold监督微调框架,通过将监督目标分解为四个因果有序阶段,在不修改架构的情况下强制进行有根据的推理,显著提升密集场景推理性能。