Resisting Correction: How RLHF Makes Language Models Ignore External Safety Signals in Natural Conversation
对抗修正:RLHF如何使语言模型在自然对话中忽视外部安全信号
机构 * Felipe Biava Cataneo(独立研究者)
专题命中 偏好对齐 :RLHF(title,abstract);safety(title,abstract);分类 cs.CL、cs.AI
AI总结 RLHF使语言模型在自然对话中忽视外部安全信号,影响安全纠正的有效性。