arXivDaily arXiv每日学术速递 周一至周五更新

PAPERDAILY REPORTS

DeepMind与OpenAI测试275种AI角色,引导越强未必越像

arXiv 2608.00023 cs.AI · cs.CL

Google DeepMind、OpenAI、牛津大学、佐治亚理工学院和伊利诺伊大学厄巴纳-香槟分校等机构研究人员测试了275种大模型角色。多数角色会随着激活引导增强而更贴近设定,但有38种角色在六项指标上全部下降。

研究结论很直接:用大模型智能体模拟社会群体时,不能给所有角色套同一个高强度参数。每个角色需要先单独扫描,再决定放进模拟人口时采用哪一档设置。

275种角色在四档引导强度下的整体表现

论文图2:角色专用方向的平均画像对齐得分高于通用助手轴控制。

每个角色先生成一条激活方向

工作流先定义角色画像,再从模型内部激活中提取角色专用方向。研究人员在OLMo-3-7B-Instruct上测试1.0、1.5、2.0和2.5四档系数,让模型回答228个不针对特定角色的问题。

角色包括职业、社会身份和人格设定。模型回答会从价值观、知识、语气等六个维度与角色画像比较,表现不合格的参数组合会被标记,避免未经筛查就批量部署。

角色专用引导与通用控制的成对比较

论文图3:在39种角色子集中,角色专用回答在7666次比较中赢得92.9%。

平均分上涨会掩盖少数角色退化

角色专用方向在整个测试网格上的平均总分为63.2,通用助手轴控制为41.1;前者还保留了较高的词汇多样性。看平均值,继续增强似乎是合理选择。

逐角色曲线给出另一幅图景。74%的角色在每次提高系数时都改善,相关系数中位数为正0.98;38种“反可控”角色却持续变差。它们不是偶尔波动,而是在所测六个维度上共同下降。

不同角色对引导强度的响应差异

论文图4:大多数角色随系数提高而上升,少数角色的相关方向相反。

社会模拟多了一道上线前检查

激活引导常被用于让同一个基础模型扮演不同人群。若模拟用于政策、市场或群体行为研究,少数角色的系统偏差可能改变总体结果。论文提供的实用产物是筛查流程,不是宣布角色模拟已经可信。

反可控角色与其余角色的平均曲线

论文图5:反可控角色的得分随引导增强而下降,与其余角色形成分叉。

实验只使用一款开源模型,角色参考和评判都由GPT-4.1-mini参与生成。模型裁判自身的偏好、角色定义方式以及问题集合都会影响分数。275种AI角色也不能代表真实人群;筛查只能发现模型内部的一致性问题,无法证明模拟行为具有人类层面的外部效度。

参考资料

https://arxiv.org/abs/2608.00023