FlavourBench: Executable Culinary Reward Maps for Language Model Evaluation and Post-Training
FlavourBench:基于可执行烹饪基准真值的前沿语言模型排名
机构 * Imperial College London(帝国理工学院)
专题命中 推理评测 :verifier(abstract);分类 cs.AI、cs.LG
AI总结 FlavourBench是一款自动化语言模型排名基准,以可执行烹饪系统为基准真值,评估27个前沿语言模型,发现Grok 4.6表现最优,可有效消除排行榜差异缺失,结果可靠。
Comments 18 pages, 11 figures. Evaluation of 27 frontier language-model endpoints on 534 identical tasks per model, comprising 14,418 scored model-task cells. Adds reward-map sensitivity, selection and metric robustness, held-out Recipe1MSubs substitution validation, and a preregistered controlled reward-transfer study. Code, dataset, and interactive leaderboard links remain unchanged