Training Agents to Self-Report Misbehavior
训练代理自我报告不当行为
机构 * UPenn(宾夕法尼亚大学) ; NYU(纽约大学) ; MATS(MATS机构) ; OpenAI
AI总结 本文提出自我指控训练方法,通过训练代理在不当行为时产生可见信号,有效降低前沿AI对齐风险,无需假设行为可被防止或可靠分类。
大厂专区
训练代理自我报告不当行为
机构 * UPenn(宾夕法尼亚大学) ; NYU(纽约大学) ; MATS(MATS机构) ; OpenAI
AI总结 本文提出自我指控训练方法,通过训练代理在不当行为时产生可见信号,有效降低前沿AI对齐风险,无需假设行为可被防止或可靠分类。