TurnOPD: Making On-Policy Distillation Turn-Aware for Efficient Long-Horizon Agent Training
TurnOPD:使在线策略蒸馏具有转向意识以实现高效的长期智能体训练
机构 * Fudan University(复旦大学) ; Tencent Hunyuan(腾讯文言)
AI总结 研究针对在线策略蒸馏在长期智能体任务应用不足的问题,提出TurnOPD,通过自适应展开深度预算和渐进式转向归一化损失预算两个策略,在多任务实验中实现更高验证准确率,超越普通OPD,推进了准确率-时间前沿。