From Refusal to Recovery: A Control-Theoretic Approach to Generative AI Guardrails
从拒绝到恢复:一种生成AI防护机制的控制论方法
机构 * Robotics Institute, Carnegie Mellon University(卡内基梅隆大学机器人研究所) ; Department of Electrical and Computer Engineering, Princeton University(普林斯顿大学电气与计算机工程系) ; Equal Advising(平等指导)
专题命中 知识编辑与模型理解 :LLM(abstract,abstract_cn);分类 cs.AI
AI总结 本文提出了一种基于控制论的生成AI防护机制,通过实时监控和主动纠正高风险输出,提供了一种动态替代传统标志和阻断方法的解决方案。
Journal ref Second International Association on Safe and Ethical AI Conference (IASEAI 2026)