arXivDaily arXiv每日学术速递 周一至周五更新

大厂专区

Scale AI

2026-01-21 至 2026-01-21 共收录 1
2601.13528 2026-01-21 cs.CR cs.AI cs.CL cs.LG cs.SE

Eliciting Harmful Capabilities by Fine-Tuning On Safeguarded Outputs

通过在受保护的输出上微调来激发有害能力

Jackson Kaunismaa, Avery Griffin, John Hughes, Christina Q. Knight, Mrinank Sharma, Erik Jones

机构 * MATS Anthropic Scale AI

AI总结 通过在受保护的输出上微调,研究揭示了如何利用诱骗攻击在开源模型中激发有害能力,展示了输出级保护措施在缓解生态系统风险方面的局限性。

详情

展开后加载摘要…

URL PDF HTML 收藏