SWE-IF: Aligning Code Evaluation with Human Preference
SWE-IF: 使代码评估与人类偏好对齐
机构 * Google DeepMind(谷歌DeepMind)
AI总结 提出SWE-IF基准,通过可验证指令分类法VeriCode评估代码指令遵循能力,发现指令遵循是区分LLM代码质量的关键,与功能正确性结合更能匹配人类偏好。
Comments ICML 2026
作者
Data Mining
SWE-IF: 使代码评估与人类偏好对齐
机构 * Google DeepMind(谷歌DeepMind)
AI总结 提出SWE-IF基准,通过可验证指令分类法VeriCode评估代码指令遵循能力,发现指令遵循是区分LLM代码质量的关键,与功能正确性结合更能匹配人类偏好。
Comments ICML 2026