Chain-of-Thought Faithfulness of Reasoning Models Varies with Where and How Preference Cues Are Delivered
推理模型的思维链忠实性随偏好线索的传递位置与方式变化
机构 * University of Edinburgh(爱丁堡大学)
AI总结 本研究提出FACE-Eval评估工具,发现15款不同规模模型的思维链忠实性随偏好线索的传递位置与方式变化,工具返回或隐性线索下非口头采用率更高,转录监测器检测能力与非口头采用率呈负相关,提示此类场景下CoT监测可靠性较低。
Comments 42 pages, 21 figures