arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

大型语言模型(LLMs)能否模拟新手程序员的错误概念?

Can LLMs Simulate Novice Programmers' Misconceptions?

Batuhan Yeltekin, Daniel Bauer

arXiv 2610.10656首次发表:更新:

发表机构

Columbia University(哥伦比亚大学)

机构由 AI 辅助整理,请以论文原文为准。

AI 中文总结

该研究评估13个LLMs在代码追踪问题上处理新手编程错误概念的能力,发现前沿模型表现可靠,小型模型动态执行困难,代码调优模型模拟错误概念时会回归正确执行,正误判断形式的诊断更易。

AI 中文摘要

我们评估了13个大型语言模型(LLMs)在代码追踪问题上生成、解决、模拟和诊断新手编程错误概念的能力。前沿模型可可靠完成这些任务,而参数规模≤14B的小型模型在动态执行方面存在困难;值得注意的是,经代码调优的模型在错误概念模拟中会回归正确执行,表现不佳;最后,正误判断题形式的错误概念诊断比开放式生成任务容易得多。

英文摘要

We evaluate 13 LLMs on generating, solving, simulating, and diagnosing novice programming misconceptions on code-tracing problems. While frontier models reliably perform these tasks, small models ($\le$14B) struggle with dynamic execution. Notably, code-tuned models fail during misconception simulation by reverting to correct execution. Finally, misconception diagnosis is significantly easier in True/False formats than in open-ended generation tasks.

论文原文

arXiv 摘要页 · PDF 原文 · HTML 原文

↑