Reinforcement Learning for Continuous-Time Jump Markov Decision Processes with Applications to Network Dynamic Pricing
面向连续时间跳跃马尔可夫决策过程的强化学习及其在网络动态定价中的应用
机构 * The Chinese University of Hong Kong(香港中文大学) ; University of Toronto(多伦多大学)
AI总结 该研究针对通用离散状态空间的连续时间跳跃马尔可夫决策过程,建立q学习理论基础并开发无模型算法,其在网络动态定价应用中优于基准方法。