Position: The Complexity of Perfect AI Alignment -- Formalizing the RLHF Trilemma
位置:完美AI对齐的复杂性——形式化RLHF三重困境
机构 * Berkeley AI Safety Initiative (BASIS), University of California, Berkeley(伯克利人工智能安全倡议(BASIS),加州大学伯克利分校) ; AWS Generative AI Innovation Center, Amazon Web Services(亚马逊网络服务生成式人工智能创新中心) ; Meta AI ; Stanford University(斯坦福大学) ; Northeastern University, Seattle, WA, USA(东北大学,西雅图,华盛顿州,美国)
AI总结 研究提出RLHF三重困境,指出在安全、公平和稳健之间存在根本性权衡,并通过复杂性分析证明实现全球代表性需要超多项式计算资源。
Comments Accepted at NeurIPS 2025 Workshop on Socially Responsible and Trustworthy Foundation Models (ResponsibleFM)