arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型对齐与安全

大模型对齐、安全、越狱、红队、提示注入和可信评测。

2026-08-26 至 2026-08-26 共收录 1 信号源:cs.CL, cs.AI, cs.CY, cs.LG

1. 越狱攻击 1 篇

2608.23959 2026-08-26 cs.CR cs.AI cs.IR cs.LG 新提交 90%

NeuronGuard: Robust LLM Safety Alignment via Ablation-Aware Safety Signal Redistribution

NeuronGuard:通过感知消融的安全信号重新分配实现鲁棒的大语言模型安全对齐

Anjun Gao, Yueyang Quan, Yufei Xia, Zhuqing Liu, Minghong Fang

专题命中 越狱攻击 :alignment(title,abstract);safety(title,abstract);jailbreak(abstract);分类 cs.AI、cs.LG

AI总结 NeuronGuard是一种微调阶段防御方法,通过重新分配安全信号抵御越狱和神经元级攻击,在三个LLM、六种攻击下实现近乎零攻击成功率且保持任务准确率。

Comments To appear in EMNLP 2026 (Findings)

详情

展开后加载摘要…

URL PDF HTML 收藏