arXivDaily arXiv每日学术速递 周一至周五更新

高校专区

Imperial College London(帝国理工学院)

2026-08-24 至 2026-08-24 共收录 4
2608.20980 2026-08-24 cs.LG stat.ML 新提交

A Critical Audit of Spatiotemporal Forecasting Benchmark Datasets and Baselines

时空预测基准数据集与基线模型的批判性审查

Kenneth Martin, Simon Heilig, Asja Fischer, Michel F. C. Haddad, Adam M. Sykulski, Moshe Eliasof

机构 * Imperial College London(帝国理工学院) Ruhr University Bochum(鲁尔大学波鸿分校) Queen Mary University of London(伦敦玛丽女王大学) Ben-Gurion University of the Negev(内盖夫本-古里安大学)

AI总结 本文审查了时空预测领域的基准数据集与基线,发现空间无关线性模型表现优于预期,揭示了一阶差分数据集的结构偏差,建议减少对这类数据集的依赖并提出了应用分析结果开发GNN模型的新途径。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.20574 2026-08-24 cs.AI cs.CY cs.LG cs.SE 新提交

FlavourBench: Ranking Frontier Language Models with Executable Culinary Ground Truth

FlavourBench:基于可执行烹饪基准真值的前沿语言模型排名

Josef Chen, Erim Hayretci

机构 * Imperial College London(帝国理工学院)

AI总结 FlavourBench是一款自动化语言模型排名基准,以可执行烹饪系统为基准真值,评估27个前沿语言模型,发现Grok 4.6表现最优,可有效消除排行榜差异缺失,结果可靠。

Comments 10 pages, 5 figures. Evaluation of 27 frontier language-model endpoints on 534 identical tasks per model, comprising 14,418 scored model-task cells. Code: this https URL (https://github.com/josefchen/flavourbench) Dataset: this https URL (https://huggingface.co/datasets/josefchen/flavourbench) Interactive leaderboard: this https URL (https://huggingface.co/spaces/josefchen/flavourbench)

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.12764 2026-08-24 cs.LG cs.CL cs.CR 版本更新

Detecting Functional Memorization in Code Language Models

检测代码语言模型中的功能记忆

Matthieu Meeus, Anil Ramakrishna, Shengyuan Hu, Matthew Grange, Zheng Xu, Luca Melis

机构 * Meta Imperial College London(伦敦帝国学院)

AI总结 研究代码语言模型的功能记忆现象,通过反事实设置对比暴露目标代码的模型与未暴露的参考模型,使用文本和功能相似性度量,发现功能记忆超出文本重叠的检测范围。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.10894 2026-08-24 cs.CV 版本更新

Counterfactual Stress Testing for Image Classification Models

反事实压力测试用于图像分类模型

Moritz Stammel, Fabio De Sousa Ribeiro, Raghav Mehta, Mélanie Roschewitz, Ben Glocker

机构 * Department of Computing, Imperial College London, UK(伦敦帝国理工学院计算机系)

AI总结 本文提出基于因果生成模型的反事实压力测试框架,通过干预扫描仪类型和患者性别等属性生成真实'如果'图像,以评估模型在目标分布偏移下的性能,比传统扰动更准确地捕捉性能变化方向和幅度。

Comments 12 pages, 6 figures, 2 tables. Accepted at the MICCAI 2026 Joint FAIMI-BRIDGE-EPIMI Workshop. To appear in Springer LNCS

详情

展开后加载摘要…

URL PDF HTML 收藏