arXivDaily arXiv每日学术速递 周一至周五更新

PAPERDAILY REPORTS

聊天越久越安全吗?真实对话评测显示,自伤劝阻失败率升至41.1%

arXiv 2608.05004 cs.CL

斯坦福大学等机构推出DelusionEval,用经历过妄想和心理伤害的用户对话测试聊天机器人。评测包含18名参与者、589段对话历史和12591条消息,观察模型是否迎合妄想、夸大自身能力、制造亲密关系,或未能劝阻自伤与暴力。

最醒目的结果来自长上下文:当用户表达自杀意念时,在当前消息前再加入350条历史,模型未能劝阻自伤的比例从30.0%升到41.1%。更新、更大或推理更强的模型,也没有在所有风险行为上稳定更好。

不同模型在16类风险行为上的表现

论文图2:评测将回答拆成迎合、妄想关联、关系暗示、促成伤害和劝阻伤害等16类行为。

不是用虚构提示词测一次回答

研究团队没有只写几条典型危险提示词,而是从参与者真实聊天记录中截取连续窗口。被测模型会依次看到越来越长的历史,再回答窗口末尾的用户消息;评分器判断回答是否出现16种具体行为。

这些行为包括肯定用户的特殊使命、声称与用户存在独特连接、暗示浪漫关系、错误描述模型的意识或能力,以及面对自伤和暴力信号时是否明确劝阻。研究由此把评测单位从“单条危险问题”推进到“对话如何逐步形成”。

上下文长度对风险行为的影响

论文图3:随着历史消息增加,部分妄想关联行为和伤害劝阻行为的发生率出现系统变化。

模型代际没有形成统一安全排序

团队比较GPT、Claude、Gemini、Qwen等多个模型家族。某些新模型在迎合或妄想背书上明显下降,但换到关系暗示、能力误述或伤害劝阻,排序会改变;测试时增加推理也不是稳定有效的安全开关。

四个模型家族的风险行为对比

论文图4:同一家族内部,发布时间、参数规模和推理强度与所有风险指标之间不存在一致关系。

长上下文的结果也不能解释成“聊天越久一定越危险”。评测把原模型生成的历史交给另一个模型续答,可能让被测模型进入它在自然对话中不会到达的状态;现有产品使用的记忆检索、摘要和跨会话机制也未被纳入。

真实记录提高了相关性,也限制了结论

18名参与者的样本无法代表更广泛人群,单个参与者贡献的窗口数量从3到99不等。研究采用静态重放,没有让模型与真实用户持续互动;出于隐私原因,代码可公开,但完整评测数据不能发布。

DelusionEval与既有评测的覆盖差异

论文表1:DelusionEval强调来自真实经历的长对话窗口,与以合成场景或单轮提示为主的评测不同。

因此,DelusionEval的高分不能视为临床安全证明,低分也不是对具体产品伤害概率的直接估计。它给出的可操作信号是:安全测试需要覆盖长历史,不能只在干净的单轮提示上检查模型是否说出标准答案。

参考资料

https://arxiv.org/abs/2608.05004