Intrinsic Benefits of Categorical Distributional Loss: Uncertainty-aware Regularized Exploration in Reinforcement Learning
类别分布损失的内在优势:强化学习中的不确定性感知正则化探索
机构 * University of Alberta, Canada(阿尔伯塔大学) ; Harbin Engineering University, China(哈尔滨工程大学) ; Xi’an Jiaotong University, China(西安交通大学)
AI总结 本文提出了一种基于类别分布损失的不确定性感知正则化方法,通过增强奖励信号提升强化学习的探索效率。
Comments NeurIPS 2025; Previous Version in ICML Workshop: Exploration in AI Today (EXAIT) 2025