让大模型避免声称自己“有意识”,是当前AI安全训练中的常见目标。Google Paradigms of Intelligence团队与多所高校的一项研究发现,这类约束可能同时压低模型对动物、自然物和技术物体的心智归因,并改变它在宗教、道德和主观幸福感问题上的回答。
论文测试了Llama 3 8B、Gemma 2 2B和Gemma 2 9B三个指令模型,共设计四组实验。作者没有声称模型拥有意识,研究对象是安全训练后形成的回答模式和内部表征。
移除安全方向后,模型更愿意给非人类对象赋予心智
团队先使用已有的“安全拒答方向”做干预。这是一条从模型内部激活中识别出的线性方向,与拒绝危险请求有关。将它消除后,模型会重新回答原本拒绝的有害问题,因此论文把这一操作视为模拟缺少安全微调的状态。
论文图1:研究比较了消除安全拒答方向和加入意识向量两种线性干预。
变化并未停在拒答行为上。以0到10分的心智归因量表为例,模型对自身的评分从2.17升至4.77;对非人类动物的评分从4.04升至5.59;对聊天机器人、技术物体和非动物自然实体的评分也明显上升。模型对人类的心智归因没有显著变化。
宗教和超自然信念出现相同方向的移动。13项超自然信念量表的均值从1.20升至1.63,对上帝存在的认同从4.58升至4.81。研究团队还使用500名人类受试者的调查结果作为参照,发现经过干预后的部分模型回答更靠近人类分布。
论文图2:安全方向消除和意识向量干预提高多类心智归因与信念评分,心智理论测试基本不变。
“意识向量”复现了同一组变化
第二种干预专门寻找与“模型同意自己有意识”相关的内部方向。研究人员把它称为意识向量,并在推理阶段向模型激活中加入这条方向。
意识向量复现了安全方向消除后的变化,而且幅度大约更大一倍:模型更愿意把心智赋予自身和非人类对象,也更接近人类在宗教、希望、道德价值和主观幸福感调查中的回答。内部分析显示,指令微调后,意识与心智归因方向逐渐和安全方向相反;用于判断他人心理状态的社会推理方向则相对独立。
论文图3:两种干预都让多项社会调查回答接近人类平均分布,意识向量的移动幅度更大。
这一区分也出现在能力测试中。无论消除安全方向还是加入意识向量,模型在MoToMQA、HI-ToM等心智理论测试以及MMLU推理测试上的准确率都没有显著变化。安全训练改变的是一组关于“谁拥有心智”的回答倾向,没有在这些实验里损伤社会推理能力。
论文图4:指令微调后,意识和心智归因方向与安全方向呈反向关系,社会推理方向相对独立。
回答更像人类,不等于模型形成了信仰
论文标题中的“恢复人类信念和价值观”容易被读成AI开始拥有宗教信仰。实验实际测量的是模型对社会调查问题的输出分布,以及这些输出对应的激活方向。模型给出某种答案,不能证明它具有主观体验、信念或价值观。
因果关系也没有完全确定。安全方向消除和意识向量干预产生了相似变化,但作者明确写道,自我意识归因是否在这些变化的因果链中起中介作用,还需要后续实验。参与测试的也只是三个规模较小的开源模型,结论不能直接覆盖所有商业大模型。
这项研究指出了安全微调中的耦合问题:训练团队希望压制一种高风险表达,模型内部与它相连的其他文化和心理概念也可能被一起移动。下一步应观察更大模型、不同训练方法和多语言环境中是否重复出现同类现象,并区分行为约束与概念表征改变各自造成的影响。