Dual-Uncertainty Guided Policy Learning for Multimodal Reasoning
双不确定性引导的多模态推理策略学习
机构 * Tencent Hunyuan(腾讯文汇) ; University of Maryland(马里兰大学) ; University of North Carolina(北卡罗来纳大学)
专题命中 视觉推理 :LLaVA(abstract,abstract_cn);multimodal large language model(abstract);分类 cs.AI、cs.LG
AI总结 提出DUPL方法,通过量化感知不确定性和输出不确定性来引导策略更新,在多个多模态推理基准上显著提升模型准确率,优于现有方法。