Differentiated Directional Intervention A Framework for Evading LLM Safety Alignment
差异化方向干预:一种规避LLM安全对齐的框架
专题命中 越狱攻击 :alignment(title,abstract);safety(title,abstract);分类 cs.AI、cs.LG
AI总结 本文提出DBDI框架,通过区分有害检测和拒绝执行方向,提升LLM安全对齐的规避效果。
Comments AAAI-26-AIA