Eliciting Harmful Capabilities by Fine-Tuning On Safeguarded Outputs
通过在受保护的输出上微调来激发有害能力
机构 * MATS ; Anthropic ; Scale AI
AI总结 通过在受保护的输出上微调,研究揭示了如何利用诱骗攻击在开源模型中激发有害能力,展示了输出级保护措施在缓解生态系统风险方面的局限性。
大厂专区
通过在受保护的输出上微调来激发有害能力
机构 * MATS ; Anthropic ; Scale AI
AI总结 通过在受保护的输出上微调,研究揭示了如何利用诱骗攻击在开源模型中激发有害能力,展示了输出级保护措施在缓解生态系统风险方面的局限性。