发表机构
Central South University(中南大学)
机构由 AI 辅助整理,请以论文原文为准。AI 中文总结
针对分布外幅度变化导致RL策略退化问题,基于SAC和BAPR提出CS-BAPR家族,结合六种训练稳定化设置与多种算术Actor头(NAU、KAN、MLP)以提升鲁棒性。
AI 中文摘要
强化学习(RL)策略在分布外(OOD)幅度变化下可能性能恶化。从软Actor-Critic(SAC)及其贝叶斯遗忘分段鲁棒(BAPR)前身出发,我们研究了因果符号BAPR(CS-BAPR)家族。该实用方法将六种训练稳定化设置与替代Actor头相结合:带有受神经乘法单元(NMU)启发的二次校正的神经加法单元(NAU)、Kolmogorov-Arnold网络(KAN)、或带修正线性单元(ReLU)或双曲正切激活的多层感知机(MLP)。
英文摘要
Reinforcement learning (RL) policies can deteriorate under out-of-distribution (OOD) magnitude shifts. Starting from soft actor-critic (SAC) and its Bayesian Amnesic Piecewise-Robust (BAPR) predecessor, we study the causal-symbolic BAPR (CS-BAPR) family. The practical method combines six training-stabilization settings with alternative actor heads: a Neural Addition Unit (NAU) with a Neural Multiplication Unit (NMU)-inspired quadratic correction, a Kolmogorov-Arnold Network (KAN), or a multilayer perceptron (MLP) with rectified linear unit (ReLU) or hyperbolic-tangent activations.