Evaluating Language Models on Cross-Language Code Functional Equivalence
评估语言模型在跨语言代码功能等价性上的表现
专题命中 逻辑推理 :chain-of-thought(abstract,abstract_cn);reasoning(abstract);分类 cs.CL、cs.AI
AI总结 本研究构建PolyHuman跨语言代码数据集,评估GPT-o4-mini等LLMs的代码功能等价性判断能力,发现其存在难度依赖错误、语言敏感性及运行不稳定等局限,无法可靠捕获功能等价性。
Comments 20 pages. To appear in the 20th International Symposium on Empirical Software Engineering and Measurement (ESEM 2026), LIPIcs vol. 394, Article No. 41