ARBITER: Reasoning Trajectory Basins and Majority Vote Failures in Test-Time Sampling
ARBITER:测试时采样中的推理轨迹盆地与多数投票失败
机构 * School of Computing and Information Systems(计算与信息系统学院) ; University of Melbourne(墨尔本大学)
专题命中 测试时计算 :reasoning(title,abstract);分类 cs.LG
AI总结 本文发现语言模型测试时采样的推理轨迹会聚集成少数“推理盆地”,导致多数投票选择最稳定而非最准确的盆地,并提出ARBITER方法通过保守加性证据修正共识,从样本池中恢复部分正确性。
Comments Preprint. 34 pages, 2 figures