Do MLLMs Really See It: Reinforcing Visual Attention in Multimodal LLMs
MLLMs真的能看见吗:在多模态大语言模型中强化视觉注意力
机构 * Shanghai Jiao Tong University(上海交通大学) ; Northwestern Polytechnical University(西北工业大学)
专题命中 其他多模态 :multimodal(title,abstract);分类 cs.CV、cs.AI
AI总结 SAYO通过强化学习框架引入区域级视觉注意力奖励,提升多模态大语言模型的视觉聚焦能力,从而在多种推理和感知任务中取得性能提升。