Driving Beyond Privilege: Distilling Dense-Reward Knowledge into Sparse-Reward Policies
超越特权:将密集奖励知识蒸馏到稀疏奖励策略中
机构 * Department of Electrical and Computer Engineering, University of Michigan-Dearborn(电气与计算机工程系,密歇根大学迪尔伯恩分校)
专题命中 模型式强化学习 :world model(abstract);world model(abstract);latent dynamics(abstract);model-based reinforcement learning(abstract)
AI总结 本文提出通过密集奖励蒸馏学习稀疏奖励策略,提升自动驾驶在稀疏目标上的泛化能力。