SafeRBench: Dissecting the Reasoning Safety of Large Language Models
SafeRBench: 解析大语言模型推理安全性的本质
机构 * Nanjing University(南京大学) ; Fudan University(复旦大学) ; Carnegie Mellon University(卡内基梅隆大学) ; Chinese Academy of Sciences(中国科学院) ; Nanyang Technological University(南洋理工大学)
专题命中 安全评测 :safety(title,abstract);alignment(abstract);分类 cs.AI
AI总结 SafeRBench通过端到端评估方法解析大语言模型推理过程中的安全性问题,提出风险分层探测、微思维分析和10项细粒度指标,揭示大模型在增强安全性的同时可能增加可操作风险的悖论。
Comments 29 pages, 8 figures