arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

大厂专区

Anthropic

2026-04-17 至 2026-04-17 共收录 1
2604.14865 2026-04-17 cs.CL cs.CR

Segment-Level Coherence for Robust Harmful Intent Probing in LLMs

分段级一致性用于LLMs中鲁棒有害意图探测

Xuanli He, Bilgehan Sel, Faizan Ali, Jenny Bao, Hoagy Cunningham, Jerry Wei

机构 * University College London(伦敦大学学院) Virginia Tech(弗吉尼亚理工大学) Anthropic

AI总结 本文提出分段级一致性方法,通过多证据token增强检测鲁棒性,在固定误报率下提升真阳性率35.55%,并在对抗性微调下仍能有效检测有害意图。

Comments preprint

详情

展开后加载摘要…

URL PDF HTML 收藏