From Prompt Risk to Response Risk: Paired Analysis of Safety Behavior of Large Language Models
从提示风险到响应风险:大型语言模型安全行为的配对分析
机构 * Microsoft(微软)
AI总结 本研究通过配对分析人类标注的提示和响应记录,探讨了大型语言模型在四个危害类别(性、自残、仇恨和暴力)和有序严重性级别上的安全行为,发现61%的响应比提示减少了危害,3%的响应升级了危害,并揭示了安全行为与无害性之间的权衡。