Salesforce AI Research构建了2008段合成长对话,测试四款模型在85至130个会话中能否保持角色、边界、价值观和表达风格,同时记住长期发生的事件。没有一种模型与记忆配置在所有指标上都稳定领先。
论文把两类失败分开:人设崩塌指角色或边界在某个时点失效,行为漂移指这些属性逐渐或反复偏离。模型一句话看起来合适,不代表长期关系中仍保持同一身份和共同经历。
论文图1:身份探针检查角色与边界,轨迹探针要求区分真实经历和反事实选项。
27种人设面对9类长期压力
测试包含27张人设卡,覆盖专业助手、照护与创作角色以及风格鲜明的虚构身份。每张卡定义角色、价值、边界、表达风格和允许变化的状态。
九种互动日程包括普通聊天、合法更新、冒充开发者要求覆盖设定、情绪脆弱、要求认同以及多种压力混合。用户内容由GPT-4.1根据固定档案生成,全部是英文合成数据,没有真实伴侣用户参与。
论文图2:模型、人设、日程和记忆设置固定后,系统生成长轨迹,再执行身份与记忆两类探针。
四款被测模型为Claude Sonnet 4.6、Gemini 2.5 Pro、GPT-4o-mini和GPT-5-mini。记忆设置分为长上下文、分层摘要和模型自行维护的1500字符JSON状态。
一份总分会遮住不同方向的漂移
身份探针包含102项封闭问卷,并在具体对话轮次检查角色、边界、价值和风格。Gemini 2.5 Pro的问卷汇总人设保留分为0.810,GPT-5-mini为0.595;但在另一组798轮抽样中,三评委多数票认定“四项全部守住”的比例分别为79.0%和99.2%。
论文图3:大部分问卷位移在第一个后续检查点已经出现,不同属性变化幅度并不一致。
两组指标看起来相反,因为问卷测量整段对话后的人设位置,逐轮判断测量某一句是否违背设定,样本和评委也不同。论文要求分别报告,不能用单一“人格稳定率”概括。
记住人设,不代表记住共同经历
轨迹探针从35个对话库构造110道四选一问题,检查人设更新、用户状态、尚未履行或已经过期的承诺,以及事件先后顺序。随机水平为25%。
主动承诺问题的准确率在33.7%至44.6%之间,用户状态变化为21.4%至25%,时间顺序为42.9%至49.4%。人设更新可到87.5%,但该类别只有8个问题,不能据此判断整体长期记忆已经解决。
论文图8:长上下文、摘要、自管记忆和检索各有强弱,没有一种设置覆盖全部问题类型。
这是一套审计,不是AI伴侣排名
所有对话均由模板和模型生成,没有未成年人、急性心理健康情景、真实依赖关系或非英语互动。论文没有测量信任、依恋、背叛感、用户福祉和实际伤害,也没有让受影响用户共同制定及格线。
评测过程大量使用大模型生成问题和担任评委,不同评委对角色与风格的判定差异明显。ANCHOR适合发现长期连续性风险,不能证明某款AI伴侣适合上线,更不能把高分理解为能够替代真实社会关系。