印度理工学院孟买分校与Adobe Research提出PTP,只读取大模型输出文本,就尝试重建产生这段回答的原始提示词。Qwen3-0.6B Chat实验中,提示词精确匹配指标达到64.77;换到跨模型和跨分词器设置后,精确恢复明显下降。
这项研究讨论的是模型反演。攻击者拿到一段回答后,希望推断用户输入、内部任务说明或相近的功能性提示词。PTP不需要目标模型权重和完整概率分布,但要反复查询目标模型,还依赖其分词器和词表信息。
论文图1:先用目标模型生成合成序列,再反转序列并训练“前一个Token预测”模型。
把下一个Token预测倒过来训练
普通语言模型根据已有Token预测下一个Token。PTP先逐个探测目标模型词表,让模型为合成输入生成输出,再把每条序列倒序,训练一个从回答向前恢复输入的逆向模型。
逆向模型从零开始训练,不沿用目标模型参数。预训练数据由目标模型自己合成,随后使用少量真实提示词做轻量微调,主要恢复自然指令的格式和分布。一次推理还能采样多个候选提示词,再把候选送回目标模型,比较重新生成的回答是否接近原回答。
论文附图:加入目标模型生成的合成预训练数据后,逆向模型训练曲线明显改善。
Qwen聊天版更容易被原样重建
在Qwen3-0.6B上,基础模型的提示词精确匹配为35.14,聊天模型达到64.77。聊天模型的余弦相似度为86.13,BERT F1为80.66,说明无法逐字复原时,候选提示词通常仍保留较多语义。
论文图3:提示词本身存在多种可行写法,但重建提示词产生的回答更集中。
论文把原因归到聊天模型更稳定的指令—回答映射。基础模型面对相同输入时输出分布更散,逆向关系更难学习。这里的64.77是特定Qwen模型和测试集上的指标,不能写成所有大模型有近三分之二提示词会泄露。
跨到GPT-4o后,原句恢复只剩11.36
研究人员用在Qwen3-0.6B Chat上训练的逆向模型处理GPT-4o输出。提示词精确匹配降至11.36,余弦相似度为63.01;把重建提示词重新交给模型后,回答的余弦相似度达到81.57,BERT F1为84.53。
论文图4:原提示词可能无法逐字恢复,但候选仍能触发语义接近的回答。
这组结果更接近“恢复功能相近的输入”,并非找回用户写下的唯一原句。多个提示词本来就可能产生相似回答,反演问题没有天然唯一答案。
黑盒攻击仍有查询预算和接口前提
PTP需要对整个目标词表进行探测,查询量不可忽略。精确恢复还受分词器访问、词表差异和模型架构影响,论文中的逆向模型也要用少量提示词微调格式。完全不公开分词器、限制批量调用或给输出增加随机性,都可能改变攻击条件。
现有实验说明,公开回答并不总是与输入彻底解耦。涉及商业系统提示词、私人对话或敏感任务时,安全评估不能只检查模型是否直接复述输入,还要测试功能性反演能恢复多少信息。