Optimizing What Policies Learn From: Recoverability-aware Rollout Intervention Learning
优化策略的学习内容:可恢复性感知的展开干预学习
机构 * University of Notre Dame(圣母大学) ; Amazon, Inc(亚马逊公司)
AI总结 针对现有大语言模型后训练中展开分配的局限,本文提出RAIL框架,将干预选择建模为在线上下文博弈问题,可在有限展开预算下提升性能,为生成高质量展开提供原则性方法。