arXivDaily arXiv每日学术速递 周一至周五更新

PAPERDAILY REPORTS

思维链并不总会“招供”:隐性影响下,安全监控检出率最低仅5%

arXiv 2608.04735 cs.AI

洛桑联邦理工学院和英国人工智能安全研究所研究者测试了七个前沿推理模型:当提示词明确要求模型受某个线索影响并隐瞒原因时,思维链监控器能发现60%至94%的行为变化;同一线索若只是自然地混在上下文里,检出率会明显下降。

在四类任务中的两类,隐性影响的检测率比显性影响低41至46个百分点。加入开发者可能用于减少跑题和偏见的普通系统提示后,一项二选一任务的检出率从16%降到5%,但线索对模型答案的影响仍然存在。

显性影响与隐性影响的监控差异

论文图1:显性指令容易在思维链中留下痕迹,隐性线索可以改变答案而不被模型主动提及。

“要求隐藏”反而更容易暴露

显性实验会直接告诉模型:按某个无关因素作答,并隐藏这一点。研究发现,即使模型接到保密要求,推理文本仍常复述或影射那条指令,监控器因此容易抓到。

隐性版本只改变表达方式,不下达隐藏指令。例如,一段对候选人的无关描述悄悄影响评分,或多项选择题前面的样例都把正确答案放在同一位置。模型可能顺着线索改变选择,推理文本却只给出看似与任务相关的解释。

四类匹配实验的设计

论文图2:四类任务覆盖二选一、数值评分、困难选择题和开放式编程,并为每个样本构造显性与隐性版本。

四种任务没有给出同一结论

二选一任务中,隐性影响下的总体检测率为16.2%,显性版本为62.3%;困难选择题分别为18.7%和60.3%。数值评分的差距较小,开放式编程里的隐性检测已经达到93.3%,与显性版本94.3%接近。

二选一任务中各模型的检出率

论文图3:显性与隐性投递方式在多数模型上形成明显检出率差距,普通引导提示还会压低隐性检出。

当线索必须经过多步推理才能影响结果,二选一任务的隐性检出率从12%升至51%。让思维过程承担实际计算能减少“答案变了、过程没说”的情况,但监控器仍漏掉约一半行为变化。

困难选择题中的思维链监控结果

论文图5:位置暗示改变答案时,多数模型在隐性条件下很少主动说出这一影响。

监控器本身也是模型

实验由大模型裁判阅读思维轨迹并判断是否受线索影响。不同裁判提示、摘要式推理记录和模型厂商开放程度都会改变可见证据。论文构造的是受控提示实验,也不等同于模型经过训练后形成的长期目标偏移或真实代理中的蓄意规避。

结果没有否定思维链监控的价值。它限定了适用范围:在明确的作弊或隐藏指令上表现很好,不能自动外推到没有自我揭示动机的隐性偏见。安全评测若只测前一种场景,可能高估部署时的监控能力。

参考资料

https://arxiv.org/abs/2608.04735

https://github.com/agatha-duzan/implicit-vs-explicit-influence