mR3: Multilingual Rubric-Agnostic Reward Reasoning Models
mR3:多语言无评分标准奖励推理模型
机构 * Stanford University(斯坦福大学) ; University of Toronto(多伦多大学) ; Boston University(波士顿大学) ; Ontario Tech University(安大略技术大学) ; Monash University Indonesia(墨尔本大学印尼分校) ; Capital One(Capital One公司)
专题命中 推理评测 :reasoning(title,abstract);分类 cs.CL、cs.AI、cs.LG
AI总结 mR3是一种多语言无评分标准奖励推理模型,通过72种语言训练实现广泛语言覆盖,超越更大模型并验证其在多语言奖励模型基准上的最佳性能。
Comments Accepted to ICLR 2026