N-GLARE: An Non-Generative Latent Representation-Efficient LLM Safety Evaluator
N-GLARE:一种非生成式、潜在表示高效的大语言模型安全评估器
机构 * University of California, Riverside(加州大学河滨分校) ; Fudan University(复旦大学) ; South China University of Technology(华南理工大学)
专题命中 红队测试 :safety(title,abstract);red teaming(abstract);分类 cs.LG
AI总结 N-GLARE通过分析潜在表示动态,提出一种高效无输出的大语言模型安全评估方法,显著降低评估成本并提升诊断效率。