Measuring in-context algorithmic reasoning in language models against an exact Bayes-optimal reference
基于精确贝叶斯最优标准测量语言模型的上下文内算法推理能力
机构 * Oxford Immune Algorithmics(牛津免疫算法学公司) ; Oxford University Innovation(牛津大学创新公司) ; London Institute for Healthcare Engineering(伦敦医疗工程研究所) ; King’s College London(伦敦国王学院)
AI总结 本研究提出F-ICL基准,以精确贝叶斯最优标准测量语言模型的上下文内算法推理能力,发现多数模型分布与最优标准存在差距,该差距与准确率无关且不受模型规模缩小,基准已开放。