Martingale Score: An Unsupervised Metric for Bayesian Rationality in LLM Reasoning
马尔可夫得分:一种用于大语言模型推理中贝叶斯理性性的无监督度量标准
机构 * University of Cambridge(剑桥大学) ; Peking University(北京大学) ; Carnegie Mellon University(卡内基梅隆大学)
AI总结 本研究提出马尔可夫得分,用于评估大语言模型推理中的贝叶斯理性性,通过检测信念更新的违反情况来衡量求真能力。
Comments NeurIPS 2025