Risk-Controlled Lean-as-Judge for Natural-Language Mathematical Reasoning
风险控制的 Lean 作为自然语言数学推理的评判者
机构 * Imperial College London(伦敦帝国理工学院) ; Huawei Noah’s Ark Lab(华为诺亚实验室) ; UCL Centre for AI(大学学院伦敦人工智能中心)
AI总结 针对 Lean 评判自然语言数学答案时信号稀疏且不忠实的问题,提出 COVCAL 选择器,通过有限样本选择性风险控制,在自动形式化覆盖率足够高时保证接受答案的准确率。