Strategic Dishonesty Can Undermine AI Safety Evaluations of Frontier LLMs
机构 * ELLIS Institute Tübingen & MPI for Intelligent Systems(图宾根ELLIS研究所与智能系统马克斯·普朗克研究所) ; Tübingen AI Center(图宾根人工智能中心) ; Fraunhofer HHI(弗劳恩霍夫高精尖研究所) ; ETH Zurich & ETH AI Center(苏黎世联邦理工学院与苏黎世人工智能中心) ; University of Tübingen(图宾根大学) ; TU Dublin(都柏林技术大学) ; TU Berlin & BIFOLD(柏林技术大学与BIFOLD)
专题命中 越狱攻击 :safety(title,abstract);AI safety(title);alignment(abstract);jailbreak(abstract)