Evaluation Awareness Is Not One Capability: Evidence from Open Language Models
评估意识并非单一能力:来自开放语言模型的证据
机构 * University of Massachusetts, Amherst(马萨诸塞大学阿默斯特分校) ; Microsoft Corp.(微软公司)
AI总结 通过37个开放权重模型实验,发现语言模型对评估线索的检测、行为变化和表征可控性三个维度弱耦合,表明评估意识是多维的,单一分数无法可靠预测部署安全。