Learning to Reason without External Rewards
无需外部奖励的学习推理
机构 * UC Berkeley(加州大学伯克利分校) ; Yale University(耶鲁大学)
AI总结 本文提出Intuitor方法,通过内在反馈实现无需外部奖励的自主学习,实验表明其在数学基准和代码生成等任务中表现优异,为无监督学习提供了新途径。
Comments ICLR 2026
作者
Robotics / Reinforcement Learning
无需外部奖励的学习推理
机构 * UC Berkeley(加州大学伯克利分校) ; Yale University(耶鲁大学)
AI总结 本文提出Intuitor方法,通过内在反馈实现无需外部奖励的自主学习,实验表明其在数学基准和代码生成等任务中表现优异,为无监督学习提供了新途径。
Comments ICLR 2026