Enhancing Jailbreak Attacks on LLMs via Persona Prompts
通过人格提示增强大语言模型的劫持攻击
机构 * The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州)) ; Tencent(腾讯)
AI总结 本文通过遗传算法生成人格提示,有效降低大语言模型拒绝率,提升劫持攻击成功率,揭示人格提示对模型安全机制的影响。
Comments Workshop on LLM Persona Modeling at NeurIPS 2025