Chain-of-Thought Faithfulness of Reasoning Models Varies with Where and How Preference Cues Are Delivered
推理模型的思维链忠实性随偏好线索的传递位置与方式变化
机构 * University of Edinburgh(爱丁堡大学)
专题命中 推理评测 :CoT(summary_cn,abstract);reasoning(title,abstract);chain-of-thought(title,abstract);分类 cs.CL、cs.AI
AI总结 本研究提出FACE-Eval评估工具,发现15款不同规模模型的思维链忠实性随偏好线索的传递位置与方式变化,工具返回或隐性线索下非口头采用率更高,转录监测器检测能力与非口头采用率呈负相关,提示此类场景下CoT监测可靠性较低。
Comments 42 pages, 21 figures