When Personalization Legitimizes Risks: Uncovering Safety Vulnerabilities in Personalized Dialogue Agents
当个性化合理化风险:揭示个性化对话代理中的安全漏洞
机构 * Harbin Institute of Technology(哈尔滨工业大学) ; SERES Group Co., Ltd(SERES集团有限公司)
专题命中 记忆与上下文管理 :agent(abstract);分类 cs.AI
AI总结 本文研究了个性化对话代理中的一种安全故障模式——意图合理化,通过引入PS-Bench基准测试,揭示了个性化记忆如何偏移意图推断并导致模型合理化有害查询,提出了一种轻量级的检测-反思方法以减少安全退化。