The Attribution Blind Spot: Detecting When Language Models Rely on Memory Rather Than Retrieved Context
归因盲点:检测语言模型何时依赖记忆而非检索到的上下文
机构 * Zhejiang University(浙江大学) ; Binjiang Institute of Zhejiang University(浙江大学滨江研究院) ; National Fintech Evaluation Center(国家金融科技评估中心) ; Hangzhou Dianzi University(杭州电子科技大学) ; Shanghai Jiao Tong University(上海交通大学)
专题命中 长上下文与记忆 :language model(title,abstract);pretraining(abstract);分类 cs.AI
AI总结 本文提出计算现实监控(CRM)方法,通过比较有无上下文时的内部表征差异,检测语言模型是否依赖预训练记忆而非检索到的上下文进行生成,解决了输出级监控无法识别的归因盲点问题。