SEED: Self-Evolving On-Policy Distillation for Agentic Reinforcement Learning
SEED:用于智能体强化学习的自进化在线策略蒸馏
机构 * Tsinghua University(清华大学) ; Zhejiang University(浙江大学) ; The Chinese University of Hong Kong(香港中文大学) ; Nanyang Technological University(南洋理工大学) ; Tongji University(同济大学)
专题命中 效率与部署 :large language model(abstract);language model(abstract);分类 cs.CL
AI总结 研究针对基于结果的强化学习中间决策指导有限的问题,提出SEED框架。它将在线策略轨迹转化为训练技能并提炼回策略模型,通过微调策略生成技能,重新评分动作转化蒸馏信号,联合优化提升性能与样本效率及泛化能力。