2510.15110 2025-10-20 cs.LG cs.AI cs.CL DLER: Doing Length pEnalty Right - Incentivizing More Intelligence per Token via Reinforcement Learning Shih-Yang Liu, Xin Dong, Ximing Lu, Shizhe Diao, Mingjie Liu, Min-Hung Chen, Hongxu Yin, Yu-Chiang Frank Wang, Kwang-Ting Cheng, Yejin Choi, Jan Kautz, Pavlo Molchanov 机构 * NVIDIA 纠错 Comments NVIDIA-Tech Report 详情 展开后加载摘要… URL PDF HTML 收藏 复制 复制简介 复制详情 生成图片 生成简图 生成详图