The Illusion of Robustness: Aggregate Accuracy Hides Prediction Flips under Task-Irrelevant Context
稳健性的错觉:聚合准确率掩盖了与任务无关的上下文下的预测翻转
机构 * Georgia Tech(佐治亚理工学院) ; Stanford University(斯坦福大学)
AI总结 研究大语言模型在含无关上下文环境中的表现,发现聚合准确率掩盖了单个示例预测的不稳定性,如随机伪词会改变部分预测,且此不稳定性受多种因素调节,揭示了尾部风险,推动对模型进行单个示例可靠性评估。
Comments Preprint