Keep Calm and Avoid Harmful Content: Concept Alignment and Latent Manipulation Towards Safer Answers
机构 * Neuraspace(Neuraspace公司)
专题命中 越狱攻击 :alignment(title,abstract);safety(abstract);jailbreak(abstract);AI safety(abstract)
AI 大模型
大模型对齐、安全、越狱、红队、提示注入和可信评测。
机构 * Neuraspace(Neuraspace公司)
专题命中 越狱攻击 :alignment(title,abstract);safety(abstract);jailbreak(abstract);AI safety(abstract)
机构 * AI Security Lab(360人工智能安全实验室) ; Politecnico di Milano(米兰理工大学) ; Beihang University(北京航空航天大学)
专题命中 越狱攻击 :safety(abstract);jailbreak(abstract);分类 cs.AI