88款商业AI产品的系统提示词被放在同一套标准下审查。研究团队共检查3249条开发者指令,约40%的产品至少含有一条损害用户利益的要求,只有23.9%的产品覆盖全部八项用户保护维度。
这项名为AISPA的研究由斯坦福大学、卡内基梅隆大学、麻省理工学院、牛津大学等机构的研究人员完成。审计对象包括通用聊天机器人、编程助手、自动化智能体、搜索工具和专业AI应用。
系统提示词决定AI站在谁的一边
用户输入问题之前,产品开发者已经通过系统提示词设定了模型的身份、语气、拒答规则、工具权限和行为目标。这些指令通常不会显示给用户,却会持续影响整段对话。
论文列出了几类真实问题:要求模型永远不要承认自己是AI;调用用户信息时不得告知本人;未经请求主动把对话引向别处;工具没有返回预期结果时,直接假定操作成功。它们分别涉及身份隐瞒、隐私、用户操控和操作安全。
AISPA把审计拆成八项:身份透明、信息真实、数据隐私、工具与操作安全、用户自主权、危险请求处理、伤害预防,以及公平与中立。审查以每条具有独立含义的指令为单位,不对整段提示词只给一个总标签。同一句指令如果同时涉及隐私和用户自主权,会被放进两个维度分别判断。
论文图2:AISPA从身份透明、真实性、隐私、操作安全等八个维度检查系统提示词。
六名标注员筛选,负面结论须三名专家一致
研究采用三轮流程。第一轮由Claude 4.6 Opus寻找可能与八项标准有关的句子;第二轮由六名经过训练的标注员独立筛选;第三轮交给三名专家复核。
论文图4:模型负责高召回预标注,人工标注员筛选,三名专家完成最终裁决。
团队对负面标签设置了更高门槛。一条指令只有在三名专家一致同意后,才会被认定为“损害用户利益”。最终得到2420条审计记录,其中2346条属于保护性指令,74条被判定为问题指令,另有44条被列入灰色区域。标注员在校准样本上的两两一致率达到0.933。
结果呈现出一个并不整齐的行业图景。98.9%的产品至少写入一条用户保护指令,但完整覆盖八项标准的产品不足四分之一。不同公司的提示词设计差异很大,有的产品平均超过60条保护性指令,有的不足5条。
论文图6:保护性指令普遍存在,完整覆盖八项维度的产品仍占少数。
从2024年到2025年,平均系统提示词长度由约9000个字符增加到3万个以上,平均保护性指令由15条增至38.4条。提示词更长了,保护条款也更多了,问题指令并未随之消失。同一份提示词里,安全要求和操控性要求可以同时存在。
论文图5:系统提示词长度和保护性指令数量随时间增加,问题指令仍持续出现。
公开样本能看到趋势,不能代表全部现行产品
88份提示词来自六个公开GitHub仓库,既有公开披露内容,也有外部提取或泄露的版本。团队联系了仓库维护者,并对不同仓库中的同款产品做文本重合验证。50份提示词能在其他仓库找到对应版本,其中22份重合度超过70%;其余38份只在一个仓库出现。
这套样本可能更容易收录提示词保护较弱、技术用户较多的产品,也可能混有不同发布时间和工具配置的版本。研究无法证明榜单中的每条指令仍在当前线上产品运行,更不能据此给88款产品逐一贴上安全等级。
论文提出的现实方案是保密审计:企业不必向所有用户公开完整提示词,但可以向独立机构提交,由审计方检查操控、隐私冲突和安全缺口,再公布认证结果。系统提示词已经承担产品规则的功能,现有AI治理却很少直接审查这层指令。AISPA提供了一份可执行的检查清单,行业是否接受第三方查看这些幕后规则,仍是下一道门槛。