Rethinking On-Policy Distillation of Large Language Models II: One Training Example
大型语言模型的在线策略蒸馏再思考 II:一个训练示例
机构 * University of Chinese Academy of Sciences(中国科学院大学) ; Tsinghua University(清华大学) ; Northeastern University(东北大学) ; University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) ; Johns Hopkins University(约翰斯·霍普金斯大学)
AI总结 该研究通过单查询训练探究在线策略蒸馏(OPD)的训练数据作用,发现单查询 OPD 可恢复大部分全数据增益,16 个语义查询可匹配全数据效果,指出 OPD 数据过剩但算法不足,为后续研究指明方向。
Comments 29 pages, 20 figures