Studying the Korean Word-Chain Game with RLVR: Mitigating Reward Conflicts via Curriculum Learning
专题命中 逻辑推理 :reasoning(abstract);分类 cs.CL、cs.LG
Comments 10 pages
AI 大模型
大模型数学、逻辑、规划、多步推理和测试时计算能力。
专题命中 逻辑推理 :reasoning(abstract);分类 cs.CL、cs.LG
Comments 10 pages