Stable and Efficient Single-Rollout RL for Multimodal Reasoning
稳定且高效的多模态推理单次迭代强化学习
机构 * Tencent AI Lab(腾讯AI实验室) ; University of Maryland(马里兰大学) ; University of Virginia(弗吉尼亚大学) ; University of Notre Dame(诺特大学)
专题命中 测试时计算 :reasoning(title,abstract);分类 cs.CL、cs.AI、cs.LG
AI总结 MSSR通过熵基优势塑造机制,实现多模态推理中的稳定高效单次迭代强化学习。