RePolicy: Reinforcement Learning for Safety-Policy Invocation in Agent Safeguards
RePolicy:用于智能体安全保障中安全策略调用的强化学习方法
机构 * Zhejiang University(浙江大学) ; Zhongguancun Academy(中关村学院) ; University of Science and Technology of China(中国科学技术大学) ; National University of Singapore(新加坡国立大学)
AI总结 针对现有智能体安全保障方法难以适应未见轨迹和变化策略上下文的问题,提出RePolicy方法,结合PolicyTraj-20K与带可验证奖励和策略上下文扰动的GRPO,在六个智能体安全基准上取得良好安全检测与策略调用效果。