SURE: Framework for Safety to Construct Trustworthy AI
SURE:构建可信人工智能的安全框架
AI总结 提出SURE框架,通过分类对抗提示、定义理想响应模板和绝对安全评分,实现可定制且可验证的人工智能安全对齐。
Comments 14 pages, 2 figures, 8 tables. Accepted to the 4th Workshop on Ethical Artificial Intelligence: Methods and Applications (EAI) at KDD 2025