Large Empirical Case Study: Go-Explore adapted for AI Red Team Testing
大规模实证研究:为AI红队测试适应的Go-Explore
机构 * Amazon(亚马逊公司) ; Dropbox(Dropbox公司) ; Cisco(思科公司)
AI总结 该研究通过Go-Explore评估GPT-4o-mini的安全性,发现种子方差和领域知识对测试结果影响显著,单种子比较不可靠,多种子平均能降低方差,奖励塑造导致探索崩溃和假阳性。
大厂专区
大规模实证研究:为AI红队测试适应的Go-Explore
机构 * Amazon(亚马逊公司) ; Dropbox(Dropbox公司) ; Cisco(思科公司)
AI总结 该研究通过Go-Explore评估GPT-4o-mini的安全性,发现种子方差和领域知识对测试结果影响显著,单种子比较不可靠,多种子平均能降低方差,奖励塑造导致探索崩溃和假阳性。
用Tarragon使基于MoE的LLM推理更加健壮
机构 * UC Riverside(加州大学河滨分校) ; Cisco Research(思科研究) ; University of Kentucky(肯塔基大学)
AI总结 Tarragon通过将故障影响限制在个别工作者上,实现了更健壮的MoE推理,显著降低了故障导致的停滞时间。