Likelihood-Based Reward Designs for General LLM Reasoning
基于似然的奖励设计用于通用大语言模型推理
机构 * Meta FAIR ; University of Amsterdam(阿姆斯特丹大学) ; New York University(纽约大学)
专题命中 推理评测 :reasoning(title,abstract);chain-of-thought(abstract);CoT(abstract);verifier(abstract)
AI总结 本文提出基于对数概率的奖励设计,用于提升大语言模型在推理任务中的表现,尤其在可验证和不可验证场景中均表现出色。