Perceptual-Evidence Anchored Reinforced Learning for Multimodal Reasoning
基于感知证据的强化学习用于多模态推理
机构 * School of Computer Science, Wuhan University(武汉大学计算机学院) ; Meituan Inc(美团公司) ; The University of Sydney(悉尼大学)
AI总结 PEARL通过将推理锚定在验证的视觉证据上,提升多模态推理能力,有效解决视觉幻觉和奖励黑客问题。