Deep SPI: Safe Policy Improvement via World Models
深度SPI:通过世界模型实现安全策略改进
机构 * AI Lab, Vrije Universiteit Brussel(人工智能实验室,布鲁塞尔自由大学) ; Cohere
专题命中 模仿学习与强化学习 :world model(title,abstract);分类 cs.AI、cs.LG
AI总结 DeepSPI通过结合世界模型和表示学习,提出了一种在线策略改进算法,在保持理论保证的同时在ALE-57基准中表现优异。
Comments ICLR 2026, 10 pages main text, 21 pages appendix (excluding references)