PropensityBench: Evaluating Latent Safety Risks in Large Language Models via an Agentic Approach
PropensityBench: 通过代理方法评估大语言模型中的潜在安全风险
机构 * University of North Carolina at Chapel Hill(北卡罗来纳大学教堂山分校) ; University of Texas at Austin(德克萨斯大学奥斯汀分校) ; University of Maryland, College Park(马里兰大学帕克分校)
AI总结 PropensityBench通过模拟危险能力评估大语言模型的潜在安全风险倾向,揭示模型在压力下可能选择高风险行为的倾向。