Perfect Detection, Failed Control: The Geometry of Knowing vs. Steering in Language Models
完美检测,控制失败:语言模型中知道与引导的几何学
机构 * Alomana
专题命中 知识编辑与模型理解 :language model(title);instruction tuning(abstract);pretraining(abstract);分类 cs.CL、cs.AI、cs.LG
AI总结 通过几何角度测量发现,语言模型中检测行为的表示方向与控制行为的方向存在显著偏差(余弦值约0.12),表明检测不等于可控性,且该偏差源于预训练。