CriPO: Enhancing Rubric-based RL via Self-Distillation
通过自蒸馏增强基于评分标准的强化学习
机构 * Zhejiang University(浙江大学) ; ByteDance(字节跳动)
AI总结 研究基于评分标准的强化学习中探索有限问题,提出标准蒸馏策略优化(CriPO),通过策略内自蒸馏同时解决未探索标准和被抑制标准问题,在医学和科学基准测试中表现出色,减少优化步骤并提升性能。
大厂专区
通过自蒸馏增强基于评分标准的强化学习
机构 * Zhejiang University(浙江大学) ; ByteDance(字节跳动)
AI总结 研究基于评分标准的强化学习中探索有限问题,提出标准蒸馏策略优化(CriPO),通过策略内自蒸馏同时解决未探索标准和被抑制标准问题,在医学和科学基准测试中表现出色,减少优化步骤并提升性能。