It's the Thought that Counts: Evaluating the Attempts of Frontier LLMs to Persuade on Harmful Topics
想法才是关键:评估前沿大语言模型在有害话题上的说服尝试
机构 * Université de Montréal, MILA(蒙特利尔大学,MILA) ; Carnegie Mellon University(卡内基梅隆大学) ; MIT, Center for Research and Teaching in Economics(麻省理工学院,经济研究与教学中心) ; Cornell University, University of Regina(康奈尔大学, Regina大学) ; Cornell University, MIT(康奈尔大学,麻省理工学院)
专题命中 安全评测 :safety(abstract);分类 cs.AI
AI总结 本文提出APE基准测试,评估前沿大语言模型在有害话题上的说服意愿,揭示模型在有害情境下尝试说服的倾向及风险。