Not All Refusals Are Equal: How Safety Alignment Fails Cybersecurity at Scale
并非所有拒绝都是等同的:安全对齐如何在大规模情况下使网络安全失败
机构 * Cracken AI
AI总结 研究安全对齐在网络安全领域的问题,通过对24个开源语言模型的实验,以Kimi K2为例展示特定领域删减可行,探讨模型特征与删减效果的关联并分类模型,提出相关猜想。
Comments 14 pages, 11 figures. Under review at NeurIPS 2026