Cognitive Pivot Points and Visual Anchoring: Unveiling and Rectifying Hallucinations in Multimodal Reasoning Models
认知支点与视觉锚定:揭示并纠正多模态推理模型中的幻觉
机构 * Gaoling School of Artificial Intelligence, Renmin University of China(中国人民大学 龙城人工智能学院) ; South China Agricultural University(华南农业大学) ; South China Normal University(华南师范大学) ; Monash University(莫纳什大学) ; Jishou University(吉首大学) ; Hong Kong University of Science and Technology(香港科技大学) ; Tsinghua University(清华大学)
AI总结 针对多模态大推理模型在长链推理中易产生幻觉的问题,提出V-STAR训练范式,通过分层视觉注意力奖励和强制反思机制,将视觉锚定引入推理过程以减轻幻觉。
Comments TPAMI under review