Seeing Roads Through Words: A Language-Guided Framework for RGB-T Driving Scene Segmentation
通过文字看道路:一种语言引导的RGB-T驾驶场景分割框架
机构 * National University of Singapore(新加坡国立大学) ; University of Technology Sydney(悉尼科技大学)
专题命中 视觉定位与Grounding :VLM(abstract,abstract_cn);vision-language model(abstract);分类 cs.CV、cs.AI、cs.LG
AI总结 提出CLARITY框架,利用视觉语言模型先验动态调整RGB-T融合策略,并引入暗目标语义保留和层次化解码器,在MFNet数据集上达到62.3% mIoU和77.5% mAcc的新SOTA。