UltraLogic: Enhancing LLM Reasoning through Large-Scale Data Synthesis and Bipolar Float Reward
UltraLogic: 通过大规模数据合成和双极浮点奖励增强大语言模型推理
机构 * Hunyuan, Tencent(腾讯 Hunyuan) ; Waseda University(早稻田大学)
专题命中 复杂问题求解 :reasoning(title,abstract);planning(abstract);分类 cs.CL、cs.AI
AI总结 UltraLogic通过大规模数据合成和双极浮点奖励机制,提升大语言模型的推理能力,强调任务多样性和难度匹配对训练效率的促进作用。
Comments 19 pages, 6 figures, 7 tables