ArenaRL: Scaling RL for Open-Ended Agents via Tournament-based Relative Ranking
ArenaRL: 通过基于比赛的相对排名扩展强化学习以应对开放性智能体
机构 * Tongyi Lab, Alibaba Group(通义实验室,阿里巴巴集团)
AI总结 ArenaRL通过基于比赛的相对排名机制,提升开放性智能体在复杂任务中的表现,实现效率与精度的平衡。
大厂专区
ArenaRL: 通过基于比赛的相对排名扩展强化学习以应对开放性智能体
机构 * Tongyi Lab, Alibaba Group(通义实验室,阿里巴巴集团)
AI总结 ArenaRL通过基于比赛的相对排名机制,提升开放性智能体在复杂任务中的表现,实现效率与精度的平衡。