NOVER: Incentive Training for Language Models via Verifier-Free Reinforcement Learning
机构 * King’s College London(伦敦国王学院) ; The Alan Turing Institute(艾伦·图灵研究所) ; Shanghai Jiao Tong University(上海交通大学)
专题命中 测试时计算 :verifier(title,abstract);reasoning(abstract);分类 cs.CL、cs.AI、cs.LG
Comments 20 pages, 5 tables, 12 figures. accepted to EMNLP 2025