YuFeng-XGuard: A Reasoning-Centric, Interpretable, and Flexible Guardrail Model for Large Language Models
YuFeng-XGuard:一种以推理为中心、可解释且灵活的大语言模型护栏模型
机构 * Alibaba-AAIG(阿里云-阿里人工智能研究院)
AI总结 提出YuFeng-XGuard护栏模型系列,通过结构化风险预测(含风险类别、置信度分数及自然语言解释)实现可解释的多维风险感知,并采用分层推理范式平衡延迟与解释深度,同时引入动态策略机制解耦风险感知与策略执行。