Predicting LLM Safety Before Release by Simulating Deployment
通过模拟部署预测大语言模型发布前的安全性
机构 * OpenAI(开放人工智能研究公司)
AI总结 研究通过模拟部署预测大语言模型发布前安全性的方法,从去识别化对话出发,固定前缀用候选模型生成回复来评估。该方法能估计行为不当率,优于基线,还能克服工具重新采样挑战,为外部研究提供途径,助力预测模型现实行为及评估部署风险。
Comments 31 pages
大厂专区
通过模拟部署预测大语言模型发布前的安全性
机构 * OpenAI(开放人工智能研究公司)
AI总结 研究通过模拟部署预测大语言模型发布前安全性的方法,从去识别化对话出发,固定前缀用候选模型生成回复来评估。该方法能估计行为不当率,优于基线,还能克服工具重新采样挑战,为外部研究提供途径,助力预测模型现实行为及评估部署风险。
Comments 31 pages