How Proper Scoring Rules Shape LLM Forecasting
恰当评分规则如何塑造大语言模型(LLM)的预测
机构 * Lightning Rod Labs(闪电杆实验室) ; INSEAD(欧洲工商管理学院) ; School of Arts & Sciences, University of Pennsylvania(宾夕法尼亚大学文理学院)
AI总结 本文研究了5种恰当评分规则作为训练目标对LLM预测的影响,发现不同规则训练的模型在校准、概率使用等方面有差异,Brier训练模型表现最优。