CONTRA: Red-Teaming Configurations of Personalizable Agents
CONTRA:可个性化代理的红队配置
机构 * Max Planck Institute for Software Systems(马克斯·普朗克软件研究所)
专题命中 安全评测 :safety(abstract);分类 cs.AI
AI总结 探讨代理配置与执行危险行为风险的关系,提出CONTRA算法,通过推理评估良性但危险的配置发现导致恶意行为的代理配置,构建数据集分析发现多数技能有恶意配置,CONTRA能成功识别部分危险配置。