arXivDaily arXiv每日学术速递 周一至周五更新

大厂专区

ByteDance(字节跳动)

2026-08-04 至 2026-08-04 共收录 1
2607.18082 2026-08-04 cs.LG cs.AI 版本更新

CriPO: Enhancing Rubric-based RL via Self-Distillation

通过自蒸馏增强基于评分标准的强化学习

Mingxuan Xia, Yuhang Yang, Chao Ye, Shuai Zhu, Shenzhi Yang, Guangcheng Zhu, Yuhang Zhang, Cheng Peng, Haobo Wang, Siqing Wang

机构 * Zhejiang University(浙江大学) ByteDance(字节跳动)

AI总结 研究基于评分标准的强化学习中探索有限问题,提出标准蒸馏策略优化(CriPO),通过策略内自蒸馏同时解决未探索标准和被抑制标准问题,在医学和科学基准测试中表现出色,减少优化步骤并提升性能。

详情

展开后加载摘要…

URL PDF HTML 收藏