RewardMap: Tackling Sparse Rewards in Fine-grained Visual Reasoning via Multi-Stage Reinforcement Learning
RewardMap: 通过多阶段强化学习解决细粒度视觉推理中的稀疏奖励
机构 * Westlake University(西湖大学) ; Tongji University(同济大学) ; Zhejiang University(浙江大学) ; National University of Singapore(新加坡国立大学)
专题命中 视觉推理 :visual reasoning(title,abstract);visual question answering(abstract);multimodal large language model(abstract);分类 cs.CV、cs.AI
AI总结 RewardMap通过多阶段强化学习解决细粒度视觉推理中的稀疏奖励问题,提升多模态大语言模型的视觉理解和推理能力。
Comments ICLR 2026, website: https://fscdc.github.io/RewardMap/