Value Bonuses using Ensemble Errors for Exploration in Reinforcement Learning
利用集成误差的值奖金用于强化学习中的探索
专题命中 记忆与上下文管理 :agent(abstract);分类 cs.AI、cs.LG
AI总结 VBE通过集成误差设计价值奖金,实现强化学习中的首次访问乐观性和深度探索,优于现有方法。
Comments Accepted at Reinforcement Learning Conference (RLC) 2025
Journal ref Reinforcement Learning Journal, vol. 6, 2025, pp. 1894-1915