arXivDaily arXiv每日学术速递 周一至周五更新

大厂专区

2026-06-24 至 2026-06-24 共收录 1
2606.24014 2026-06-24 cs.AI cs.CL 新提交

Reinforcement Learning Towards Broadly and Persistently Beneficial Models

强化学习迈向广泛且持久有益的模型

Akshay V. Jagadeesh, Rahul K. Arora, Khaled Saab, Ali Malik, Mikhail Trofimov, Foivos Tsimpourlas, Johannes Heidecke, Karan Singhal

机构 * OpenAI

AI总结 通过真实领域中的有益行为强化学习,模型在超过80%的分布外基准上表现提升,并展现出跨领域对齐泛化与对抗攻击的持久性。

Comments Blog: https://alignment.openai.com/beneficial-rl/

详情

展开后加载摘要…

URL PDF HTML 收藏