From the Inside Out: Progressive Distribution Refinement for Confidence Calibration
从内部出发:用于置信度校准的渐进分布细化
机构 * Southeast University(东南大学) ; Kuaishou Technology(快手科技) ; SUTD(新加坡科技设计大学)
AI总结 本文提出DistriTTRL,通过利用模型置信度的分布先验逐步优化奖励信号,解决测试时训练中内部信息不一致和奖励黑客问题,提升多模型和基准的性能。
Comments 15 pages