WDL-OPD: Weak-Driven On-Policy Distillation via Mixture-Constrained Co-Training
WDL-OPD:基于混合约束协同训练的弱驱动在线策略蒸馏
机构 * Beihang University(北京航空航天大学) ; China Telecom eSurfing Cloud(中国电信天翼云)
专题命中 代码生成 :code generation(abstract);分类 cs.AI、cs.LG
AI总结 该研究提出WDL-OPD混合约束协同训练方法,在Qwen3 17亿和40亿参数实验中,于四个规模-领域设置里获最强学生检查点,提升MATH500准确率,稳定代码生成表现,支持稳定性假设。