DPRM: A Plug-in Doob h transform-induced Token-Ordering Module for Discrete Diffusion Models
DPRM: 一种用于扩散语言模型的即插即用Doob h变换诱导的令牌排序模块
机构 * City University of Hong Kong(香港城市大学) ; The Institute of Statistical Mathematics(统计数学研究所) ; University of Sydney(悉尼大学) ; Nanyang Technological University(南洋理工大学) ; The University of Tokyo(东京大学)
专题命中 后训练与偏好优化 :language model(title,abstract);分类 cs.AI、cs.LG
AI总结 提出DPRM模块,通过在线估计从置信度驱动排序逐步过渡到过程奖励引导排序,改进扩散语言模型的令牌排序策略,在九种任务中提升性能。
Comments Extended Version of ICML 2026 Fogen (Oral)