DSDR: Dual-Scale Diversity Regularization for Exploration in LLM Reasoning
DSDR:双尺度多样性正则化用于LLM推理中的探索
机构 * The Ohio State University, USA(俄亥俄州立大学) ; Case Western Reserve University, USA(凯斯西储大学) ; The Chinese University of Hong Kong, Hong Kong(香港中文大学) ; Macquarie University, Australia(麦考瑞大学) ; University of Michigan, USA(密歇根大学) ; The University of Hong Kong, Hong Kong(香港大学) ; University College London, UK(伦敦大学学院)
AI总结 DSDR通过双尺度多样性正则化提升LLM推理中的探索能力,通过全局和局部正则化机制增强路径多样性,提高学习信号稳定性。