Trajectory-Relative Hindsight Distillation for Agentic Reinforcement Learning
面向智能体强化学习的轨迹相对事后蒸馏
机构 * Zhejiang University(浙江大学) ; Shanghai AI Laboratory(上海人工智能实验室) ; Tencent(腾讯)
AI总结 针对智能体强化学习中事后信号分配不清的问题,提出TRIAL框架,通过轨迹相对步分配优化监督信号,在WebShop、ALFWorld等任务上优于GRPO及多数基线方法,提升了任务性能。