Segment-Level Coherence for Robust Harmful Intent Probing in LLMs
分段级一致性用于LLMs中鲁棒有害意图探测
机构 * University College London(伦敦大学学院) ; Virginia Tech(弗吉尼亚理工大学) ; Anthropic
AI总结 本文提出分段级一致性方法,通过多证据token增强检测鲁棒性,在固定误报率下提升真阳性率35.55%,并在对抗性微调下仍能有效检测有害意图。
Comments preprint