arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

大厂专区

Anthropic

2026-05-04 至 2026-05-04 共收录 1
2605.00267 2026-05-04 cs.LG cs.AI cs.CR

Jailbroken Frontier Models Retain Their Capabilities

突破边界模型仍保留其能力

Daniel Zhu, Zihan Wang, Jenny Bao, Jerry Wei

机构 * Anthropic

AI总结 研究发现,模型能力越强,越能抵御 jailbreak,且推理任务比知识回忆任务更易受攻击,边界点 jailbreaking 几乎无损安全模型。

详情

展开后加载摘要…

URL PDF HTML 收藏