Guardian-as-an-Advisor: Advancing Next-Generation Guardian Models for Trustworthy LLMs
顾问式守护者:推进下一代守护模型以实现可信的大语言模型
机构 * University of Notre Dame(圣母大学) ; University of California, Los Angeles(加利福尼亚大学洛杉矶分校) ; MIT-IBM Watson AI Lab(MIT-IBM沃森人工智能实验室) ; IBM Research(IBM研究院)
AI总结 本文提出Guardian-as-an-Advisor框架,通过预测风险标签和解释并前置建议,提升模型安全性和实用性,同时降低误拒率。