Safer Policy Compliance with Dynamic Epistemic Fallback
动态认知回退:更安全的政策合规性
机构 * University of Bath, UK(巴斯大学) ; National University Philippines(菲律宾国家大学)
专题命中 安全训练 :safety(abstract);分类 cs.CL、cs.LG
AI总结 本文提出动态认知回退机制,通过文本提示提升LLM对抗恶意扰动政策文本的检测与拒绝能力,DeepSeek-R1在特定设置中实现100%检测率。