Efficient Policy Optimization in Robust Constrained MDPs with Iteration Complexity Guarantees
在具有迭代复杂度保证的鲁棒约束MDP中实现高效的策略优化
机构 * New Jersey Institute of Technology(新泽西理工学院) ; Caltech(加州理工学院)
专题命中 规划决策 :agent(abstract);分类 cs.AI、cs.LG
AI总结 本文提出了一种在鲁棒约束MDP中高效优化策略的方法,通过最小化约束价值函数并最大化鲁棒奖励价值函数,在O(ε⁻²)次迭代内实现ε次优且可行的策略,无需二分搜索从而提升计算效率。