LLMs Can Unlearn Refusal with Only 1,000 Benign Samples
LLMs 可通过仅 1000 个无害样本实现拒绝反学习
专题命中 安全训练 :alignment(abstract);safety(abstract)
AI总结 通过仅 1000 个无害样本,研究发现 LLMs 可通过反学习技术降低拒绝响应,揭示安全性对齐可能依赖 token 序列记忆而非推理。
AI 大模型
大模型对齐、安全、越狱、红队、提示注入和可信评测。
LLMs 可通过仅 1000 个无害样本实现拒绝反学习
专题命中 安全训练 :alignment(abstract);safety(abstract)
AI总结 通过仅 1000 个无害样本,研究发现 LLMs 可通过反学习技术降低拒绝响应,揭示安全性对齐可能依赖 token 序列记忆而非推理。