Internalizing LLM Reasoning via Discovery and Replay of Latent Actions
将LLM推理内化:通过发现和重播潜在动作
机构 * Tsinghua University(清华大学) ; National University of Singapore(新加坡国立大学) ; Fuzhou University(福州大学)
专题命中 数学推理 :reasoning(title,abstract);chain-of-thought(abstract);test-time compute(abstract);分类 cs.CL、cs.AI、cs.LG
AI总结 STIR通过动态潜在轨迹控制实现LLM推理内化,提升准确率并减少token消耗。