On the Limits of LLM Adaptability: Impact of Model-Internalized Priors on Annotation Task Performance
论大语言模型适应性的局限:模型内化先验对标注任务性能的影响
机构 * University of Washington(华盛顿大学)
AI总结 通过毒性检测实验,研究大语言模型内化先验与指令交互的三个维度,发现近三分之二的零样本错误难以通过提示纠正,并引入定义特定熟悉度(DSF)指标,证明其与性能正相关,而文本记忆指标则无此关联。
Comments Accepted at ICML 2026 (Oral & Spotlight); PMLR vol. 306. 9 pages, 4 figures