Semantic Soft Bootstrapping: Long Context Reasoning in LLMs without Reinforcement Learning
语义软引导:无需强化学习的LLM长上下文推理
机构 * University of Maryland(马里兰大学)
专题命中 数学推理 :reasoning(title,abstract);chain-of-thought(abstract);CoT(abstract);分类 cs.CL、cs.AI、cs.LG
AI总结 本文提出语义软引导方法,通过自我蒸馏技术无需强化学习提升LLM长上下文推理能力,实验显示在数学和编程基准测试中准确率显著提升。