Beyond Output Correctness: Benchmarking and Evaluating Large Language Model Reasoning in Coding Tasks
超越输出正确性:评估大型语言模型在编码任务中的推理能力
机构 * University of California, Irvine(加州大学尔湾分校)
专题命中 推理与问题求解 :LLM(summary_cn,abstract);large language model(title,abstract);language model(title,abstract);分类 cs.AI、cs.LG
AI总结 本文提出CodeRQ-Bench,首个评估LLM在生成、摘要和分类等编码任务中推理质量的基准,通过分析现有评估器的1069个不匹配案例,提出VERA评估器,实验表明其在四个数据集上均优于基线,提升AUCROC和AUPRC最高达0.26和0.21。