Reasoning-to-Defend: Safety-Aware Reasoning Can Defend Large Language Models from Jailbreaking
机构 * Beihang University(北京航空航天大学) ; Baidu Inc.(百度公司) ; Zhongguancun Laboratory(中关村实验室)
专题命中 越狱攻击 :safety(title,abstract);jailbreak(abstract);分类 cs.CL
Comments EMNLP 2025