CyberLLMInstruct: A Pseudo-malicious Dataset Revealing Safety-performance Trade-offs in Cyber Security LLM Fine-tuning
机构 * University of Kent(肯特大学)
专题命中 越狱攻击 :safety(title,abstract);prompt injection(abstract);分类 cs.AI
AI 大模型
大模型对齐、安全、越狱、红队、提示注入和可信评测。
机构 * University of Kent(肯特大学)
专题命中 越狱攻击 :safety(title,abstract);prompt injection(abstract);分类 cs.AI
专题命中 越狱攻击 :alignment(abstract)