Safety Instincts: LLMs Learn to Trust Their Internal Compass for Self-Defense
机构 * Beijing Institute of AI Safety and Governance(北京人工智能安全与治理研究院) ; Beijing Key Laboratory of Safe AI and Superalignment(北京安全人工智能与超对齐重点实验室) ; BrainCog Lab, Institute of Automation, Chinese Academy of Sciences(脑认知实验室,中国科学院自动化研究所)
专题命中 越狱攻击 :safety(title,abstract);alignment(abstract);jailbreak(abstract);AI safety(abstract)