Equal Ranking Quality, Different Decisions: Training Order-Consistent LLM Scorers
排名质量相当,决策却不同:训练顺序一致的大语言模型评分器
机构 * Thomson Reuters Labs(汤姆森路透实验室) ; University of Toronto(多伦多大学) ; Vector Institute(矢量研究所)
AI总结 该研究发现排名质量相当的大语言模型评分器决策存在差异,提出OC-SFT方法减弱顺序依赖性,提升决策稳定性,建议对比研究需报告阈值保留内容和读者回答而非仅排名质量。
Comments 9 pages main text, 45 pages total