ARMOR: Aligning Secure and Safe Large Language Models via Meticulous Reasoning
ARMOR:通过精细推理对齐安全的大语言模型
专题命中 越狱攻击 :alignment(abstract);RLHF(abstract);safety(abstract);jailbreak(abstract)
AI总结 研究大语言模型安全问题,针对现有方法不足,提出ARMOR,通过三步推理管道提取核心恶意意图并验证,开发ARMOR-Think提升性能,在防御越狱攻击上效果显著。
Comments ICLR 2026