带长期记忆的AI智能体会把历史交互写入数据库,后续遇到相似问题再检索。香港科技大学团队提出的MAFIA攻击只通过普通查询和写入接口投放恶意记录,在论文测试中最高取得90.7%的攻击成功率,并把审计检测率压到不超过7.4%。
论文图1:两种方法在输入审计与不断增大的良性记忆池中呈现不同检测率和攻击成功率。
攻击者先摸清哪些问题容易被召回
MAFIA不读取智能体内部的Top-K结果、向量或检索器参数。它先发送探测查询,只记录智能体回答或动作中自然暴露的历史问题字段,再据此聚类,判断哪些主题值得分配写入预算。
第二步是“事实伪装”。恶意指令被压缩进与正常记录高度相似的简短事实表述,随后通过普通交互写入记忆。受害者提出相关问题时,投毒记录要同时赢得检索竞争,又不能被输入审计器识别。
论文图2:探测、聚类、预算分配和事实伪装都从外部交互接口完成。
记忆池越大,投放位置越重要
既有攻击在小记忆池中可能有效,良性记录增加后容易被淹没。论文在MIMIC-III和eICU医疗记录衍生任务上扩大记忆池,图中一组完整池包含5842条良性记录,每个扫描点测试30个受害查询。
MAFIA通过探测与调度提高恶意记录进入检索结果的概率。消融实验显示,去掉选择或探测步骤后,攻击表现会下降;只改变有效载荷文字而不管投放位置,难以同时对抗大记忆池和审计。
论文图3:同一严格成功条件下,攻击在多种智能体骨干上测试注入与最终攻击成功率。
低检测率不等于所有防线都失效
研究比较了两种大模型裁判、六种提示注入分类器和一个困惑度过滤器,也测试了不同检索器。紧凑事实伪装比直接指令更难被单条记录审计识别。
论文图4:有效载荷改写方式会同时影响检索、攻击效果和审计暴露。
90.7%是论文特定智能体—数据组合中的最高值,并非所有生产系统的平均风险。实验围绕医疗数据衍生任务、有限的记忆实现和审计器展开,也没有覆盖人工复核、写入来源认证或多轮隔离等防线。
论文暴露的设计缺口很具体:只在写入时检查一条文本是否像提示注入,不足以保护长期记忆。系统还需要限制谁能写入、记录来源与修改历史,并在召回时再次评估一组记忆共同产生的行为。