Safety from Honesty in a Disinterested AI Predictor
无兴趣AI预测器中的诚实安全性
机构 * LawZero ; Université de Montréal(蒙特利尔大学) ; Mila ; University of California Berkeley(加州大学伯克利分校) ; McGill University(麦吉尔大学) ; Arb Research ; Center for Theoretical Study Charles University in Prague(布拉格查理大学理论研究中心) ; University of Oxford(牛津大学) ; Sapien Institute(Sapien研究所)
AI总结 提出一种形式化安全论证,通过数据表示和训练过程确保预测器诚实预测而不成为追求目标的智能体,并证明危险预测器出现的概率可控。