All Roads Lead to Rome: Incentivizing Divergent Thinking in Vision-Language Models
所有道路通向罗马:激励视觉-语言模型的发散性思维
机构 * Australian National University(澳大利亚国立大学) ; Shanghai AI Lab(上海人工智能实验室) ; GE Research(通用电气研究院)
专题命中 后训练与偏好优化 :language model(title,abstract)
AI总结 本文研究了强化学习在视觉-语言模型中激发发散性思维的机制,提出MUPO方法以解决GRPO的多样性崩溃问题,提升模型的多样性和可扩展性。
Comments Accepted to CVPR2026