Jailbreak-Zero: A Path to Pareto Optimal Red Teaming for Large Language Models
Jailbreak-Zero:大型语言模型安全评估的帕累托最优渗透测试路径
机构 * Meta Superintelligence Labs(Meta超智能实验室) ; Carnegie Mellon University(卡内基梅隆大学)
专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.CL、cs.LG
AI总结 Jailbreak-Zero通过生成多样化对抗性提示并微调攻击模型,实现了LLM安全评估的帕累托最优,提高了攻击成功率并减少了人工干预需求。
Comments Socially Responsible and Trustworthy Foundation Models at NeurIPS 2025