PL-Guard: Probabilistic Logic Reasoning for LLM Guardrails
PL-Guard:面向大语言模型安全护栏的概率逻辑推理
机构 * University of Amsterdam(阿姆斯特丹大学) ; Utrecht University(乌得勒支大学)
AI总结 该研究提出神经符号安全护栏架构PL-Guard,通过分离神经落地与概率符号推理,在XSTest基准上大幅降低大语言模型的不安全依从率,虽过度拒绝率略高,但提升了推理可审计性。
Comments Preliminary version of this paper was presented at the IJCAI 2026 Workshop on Logical and Symbolic Reasoning of Large Language Models