A Survey of On-Policy Distillation for Large Language Models
大型语言模型的在线策略蒸馏综述
机构 * Tencent, China(腾讯,中国)
AI总结 本文综述了大型语言模型的在线策略蒸馏方法,探讨了蒸馏过程中如何通过反馈减少累积误差,提出了基于f-散度最小化的蒸馏框架,并分析了蒸馏与强化学习之间的联系。
Comments Ongoing Work
大厂专区
大型语言模型的在线策略蒸馏综述
机构 * Tencent, China(腾讯,中国)
AI总结 本文综述了大型语言模型的在线策略蒸馏方法,探讨了蒸馏过程中如何通过反馈减少累积误差,提出了基于f-散度最小化的蒸馏框架,并分析了蒸馏与强化学习之间的联系。
Comments Ongoing Work
HY-WU (第一部分): 一种可扩展的功能性神经记忆框架及其在文本引导图像编辑中的应用
机构 * Tencent HY Team(腾讯 HY 团队)
AI总结 提出HY-WU框架,通过功能性神经记忆模块即时生成实例特定权重更新,避免共享权重覆盖导致的干扰,解决持续学习与个性化中的灾难性遗忘问题。