Critic Experience Bank: Self-Evolving Step-Level Confidence Estimation for LLM Agents
评论家经验库:大语言模型智能体的自进化步骤级置信度估计
机构 * Pennsylvania State University(宾夕法尼亚州立大学) ; Virginia Tech(弗吉尼亚理工大学) ; Purdue University(普渡大学) ; Amazon AGI(亚马逊通用人工智能)
专题命中 长上下文与记忆 :LLM(title,abstract);分类 cs.AI
AI总结 研究大语言模型智能体的步骤级置信度估计问题,提出自进化评论家框架CEB,其通过积累自身过去判断及后果证据来估计置信度,无需训练和真实步骤标签,在多个基准和主干上校准和排名表现最佳。