GateBreaker: Gate-Guided Attacks on Mixture-of-Expert LLMs
GateBreaker: 对混合专家LLM的门控引导攻击
专题命中 越狱攻击 :alignment(abstract);safety(abstract)
AI总结 GateBreaker通过门控引导攻击破坏MoE LLM的安全对齐,发现安全机制集中在少量神经元上,禁用这些神经元显著提高攻击成功率。
Comments Accepted by USENIX Security'26
AI 大模型
大模型对齐、安全、越狱、红队、提示注入和可信评测。
GateBreaker: 对混合专家LLM的门控引导攻击
专题命中 越狱攻击 :alignment(abstract);safety(abstract)
AI总结 GateBreaker通过门控引导攻击破坏MoE LLM的安全对齐,发现安全机制集中在少量神经元上,禁用这些神经元显著提高攻击成功率。
Comments Accepted by USENIX Security'26