Positive-Unlabeled Reinforcement Learning Distillation for On-Premise Small Models
基于正例-未标记强化学习的本地小型模型蒸馏
机构 * Hong Kong Polytechnic University(香港理工大学) ; Southeast University(东南大学) ; National University of Singapore(新加坡国立大学) ; University of Tokyo(东京大学)
AI总结 本文提出了一种基于正例-未标记强化学习的本地小型模型蒸馏方法,无需人工标注或奖励模型,通过本地训练循环实现偏好优化,实验证明在低成本环境下性能优异。
Comments 22 pages, 8 figures, 7 tables