arXivDaily arXiv每日学术速递 周一至周五更新

大厂专区

ByteDance(字节跳动)

2026-08-17 至 2026-08-17 共收录 2
2608.14430 2026-08-17 cs.LG cs.CV stat.ML 新提交

Designing Reinforcement Learning for Diffusion Models: A Unified Path-Space View

为扩散模型设计强化学习:统一的路径空间视角

Yixian Xu, Yuanrui Zhang, Shengjie Luo, Liwei Wang, Di He

机构 * State Key Laboratory of General Artificial Intelligence(通用人工智能国家重点实验室) School of Intelligence Science and Technology, Peking University(北京大学智能科学与技术学院) ByteDance(字节跳动)

AI总结 本文从路径空间视角统一了扩散模型RL算法的原理,推导得到降方差值梯度形式,提出多样本KDE估计器和尺度受限权重族,在SD3.5-M等模型上验证了方法有效性并优于基线。

Comments 29 pages, 9 figures, 4 tables; work in progress

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.13124 2026-08-17 cs.LG cs.AI cs.CL 版本更新

ShortOPD: Recovering Pruned LLMs with Short-to-Long On-Policy Distillation

ShortOPD:通过短到长的策略蒸馏恢复剪枝后的语言模型

Qingyu Zhang, Qianhao Yuan, Hongyu Lin, Yaojie Lu, Xianpei Han, Le Sun, Ming Xu, Jiarui Li

机构 * ByteDance(字节跳动) Institute of Software, Chinese Academy of Sciences(中国科学院软件研究所) University of Chinese Academy of Sciences(中国科学院大学)

AI总结 研究结构化剪枝在语言模型自由形式生成任务中存在的问题,提出ShortOPD方法,通过短到长的策略蒸馏,检测重复后缀,合理分配展开预算,有效提升压缩模型分数,减少训练时间和展开令牌,推动结构化剪枝接近可部署的生成质量。

详情

展开后加载摘要…

URL PDF HTML 收藏