arXivDaily arXiv每日学术速递 周一至周五更新

高校专区

Imperial College London(帝国理工学院)

2026-08-24 至 2026-08-24 共收录 2
2608.20980 2026-08-24 cs.LG stat.ML 新提交

A Critical Audit of Spatiotemporal Forecasting Benchmark Datasets and Baselines

时空预测基准数据集与基线模型的批判性审查

Kenneth Martin, Simon Heilig, Asja Fischer, Michel F. C. Haddad, Adam M. Sykulski, Moshe Eliasof

机构 * Imperial College London(帝国理工学院) Ruhr University Bochum(鲁尔大学波鸿分校) Queen Mary University of London(伦敦玛丽女王大学) Ben-Gurion University of the Negev(内盖夫本-古里安大学)

AI总结 本文审查了时空预测领域的基准数据集与基线,发现空间无关线性模型表现优于预期,揭示了一阶差分数据集的结构偏差,建议减少对这类数据集的依赖并提出了应用分析结果开发GNN模型的新途径。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.20574 2026-08-24 cs.AI cs.CY cs.LG cs.SE 新提交

FlavourBench: Ranking Frontier Language Models with Executable Culinary Ground Truth

FlavourBench:基于可执行烹饪基准真值的前沿语言模型排名

Josef Chen, Erim Hayretci

机构 * Imperial College London(帝国理工学院)

AI总结 FlavourBench是一款自动化语言模型排名基准,以可执行烹饪系统为基准真值,评估27个前沿语言模型,发现Grok 4.6表现最优,可有效消除排行榜差异缺失,结果可靠。

Comments 10 pages, 5 figures. Evaluation of 27 frontier language-model endpoints on 534 identical tasks per model, comprising 14,418 scored model-task cells. Code: this https URL (https://github.com/josefchen/flavourbench) Dataset: this https URL (https://huggingface.co/datasets/josefchen/flavourbench) Interactive leaderboard: this https URL (https://huggingface.co/spaces/josefchen/flavourbench)

详情

展开后加载摘要…

URL PDF HTML 收藏