Cross-Layer Vision Smoothing: Enhancing Visual Understanding via Sustained Focus on Key Objects in Large Vision-Language Models
跨层视觉平滑:通过持续聚焦关键对象增强大视觉-语言模型的视觉理解
机构 * Beijing Institute of Technology(北京理工大学) ; Zhongguancun Academy(中关村学院) ; Tsinghua University(清华大学)
专题命中 幻觉与鲁棒性 :vision-language model(title,abstract);分类 cs.CV、cs.AI
AI总结 本文提出CLVS方法,通过跨层视觉记忆平滑注意力分布,提升大视觉-语言模型对关键对象的持续聚焦能力,从而增强视觉理解性能。
Comments Under Review