Fusion-fission forecasts when AI will shift to undesirable behavior
人工智能行为从有益转向有害的融合-分裂预测
机构 * Physics Department, The George Washington University(乔治华盛顿大学物理系)
专题命中 其他安全 :alignment(abstract);safety(abstract);分类 cs.AI
AI总结 本文提出一种基于群体动力学的预测方法,可预测人工智能行为从有益转向有害的转变,通过数学推导和六种独立测试验证其有效性,适用于多种AI架构。