A Close Look At World Model Recovery In Supervised Fine-Tuned LLM Planners
监督微调的大语言模型规划器中世界模型恢复的深入探究
机构 * National Laboratory of the Rockies(落基山国家实验室)
AI总结 通过可解释性实验,研究监督微调如何影响大语言模型在经典规划任务中恢复世界模型的能力,发现微调使模型线性编码动作有效性和状态谓词,且更广泛的状态空间覆盖有助于更准确的世界模型恢复。
Comments 17 pages. Under review at TMLR