Safety Recovery in Reasoning Models Is Only a Few Early Steering Steps Away
推理模型中的安全恢复仅需几步早期引导步骤
机构 * University of Maryland, College Park(马里兰大学哥伦比亚学院) ; IIT, Bombay(孟买印度理工学院) ; University of Central Florida(佛罗里达中央大学)
AI总结 SafeThink通过在推理早期干预减少攻击成功率,提升推理模型的安全性