Low-Rank Adaptation for Critic Learning in Off-Policy Reinforcement Learning
针对基于策略的强化学习中批评学习的低秩适应
机构 * University of Connecticut(康涅狄格大学) ; University of California San Diego(加州大学圣地亚哥分校) ; University of Texas at Arlington(德克萨斯理工大学) ; Qualcomm(高通)
AI总结 本文提出利用低秩适应(LoRA)作为结构正则化方法,通过冻结基础矩阵并优化低秩适配器,约束批评学习更新到低维子空间,实验表明该方法有效降低批评损失并提升整体策略性能。