发表机构
Columbia University(哥伦比亚大学)
机构由 AI 辅助整理,请以论文原文为准。AI 中文总结
该研究评估13个LLMs在代码追踪问题上处理新手编程错误概念的能力,发现前沿模型表现可靠,小型模型动态执行困难,代码调优模型模拟错误概念时会回归正确执行,正误判断形式的诊断更易。
AI 中文摘要
我们评估了13个大型语言模型(LLMs)在代码追踪问题上生成、解决、模拟和诊断新手编程错误概念的能力。前沿模型可可靠完成这些任务,而参数规模≤14B的小型模型在动态执行方面存在困难;值得注意的是,经代码调优的模型在错误概念模拟中会回归正确执行,表现不佳;最后,正误判断题形式的错误概念诊断比开放式生成任务容易得多。
英文摘要
We evaluate 13 LLMs on generating, solving, simulating, and diagnosing novice programming misconceptions on code-tracing problems. While frontier models reliably perform these tasks, small models ($\le$14B) struggle with dynamic execution. Notably, code-tuned models fail during misconception simulation by reverting to correct execution. Finally, misconception diagnosis is significantly easier in True/False formats than in open-ended generation tasks.