arXivDaily arXiv每日学术速递 周一至周五更新

期刊&会议

International Conference on Machine Learning · 会议 · Machine Learning

2025-12-08 至 2025-12-08 共收录 2
2512.03204 2025-12-08 cs.LG

Scaling Internal-State Policy-Gradient Methods for POMDPs

在部分可观测马尔可夫决策过程中的内部状态策略梯度方法扩展

Douglas Aberdeen, Jonathan Baxter

机构 * Research School of Information Science and Engineering, Australian Nat. University, ACT 0200, Australia(信息科学与工程研究学校,澳大利亚国立大学,ACT 0200,澳大利亚) Panscient Pty Ltd, Adelaide, Australia(Panscient Pty Ltd,阿德莱德,澳大利亚)

AI总结 本文提出改进的策略梯度方法,用于在无限时间 horizon 设置中学习具有记忆的策略,通过直接环境模型或模拟解决大规模 POMDPs 问题。

Journal ref Proceedings of the 19th International Conference on Machine Learning (ICML 2002), 2002, pp. 3--10

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.02383 2025-12-08 cs.LG

Reinforcement Learning in POMDP's via Direct Gradient Ascent

通过直接梯度上升在POMDP中进行强化学习

Jonathan Baxter, Peter L. Bartlett

机构 * Research School of Information Sciences and Engineering(信息科学与工程研究学校) Australian National University(澳大利亚国立大学)

AI总结 本文提出GPOMDP算法,通过直接梯度上升在POMDP中优化策略性能,仅需单条样本路径和一个自由参数,证明其收敛性并用于寻找局部最优解。

Journal ref Proceedings of the 17th International Conference on Machine Learning (ICML 2000), 2000, pp. 41--48

详情

展开后加载摘要…

URL PDF HTML 收藏