SEMDICE: Off-policy State Entropy Maximization via Stationary Distribution Correction Estimation
SEMDICE:通过平稳分布校正估计实现的非策略状态熵最大化
机构 * UC Berkeley(加州大学伯克利分校) ; Yonsei University(延世大学)
AI总结 SEMDICE通过平稳分布校正估计,从非策略数据集中学习状态熵最大化策略,实现更高效的无监督强化学习预训练。
Comments ICLR 2025