Bigger Isn't Always Better: A Comparative Evaluation of LLMs for Automated Code Review
更大未必更好:大型语言模型在自动化代码审查中的比较评估
专题命中 评测与基准 :LLM(summary_cn);large language model(abstract);language model(abstract)
AI总结 评估五个LLM在代码审查中的表现,发现较小模型Claude Haiku 4.5以更低成本超越较大模型,并揭示合成数据高估能力、差异大小主导质量等关键发现。
Comments 7 pages, 4 figures, 13 tables, 13 references