arXivDaily arXiv每日学术速递 周一至周五更新

视觉与机器人

世界模型

面向环境建模、时序预测、仿真规划、具身智能和自动驾驶的世界模型方法与应用。

2026-05-22 至 2026-05-22 共收录 3 信号源:cs.AI, cs.LG, cs.CV, cs.RO, cs.MA

1. 模型式强化学习 3 篇

2510.04280 2026-05-22 cs.LG cs.AI cs.RO 60%

A KL-regularization Framework for Learning to Plan with Adaptive Priors

一种基于KL正则化的学习规划框架:具有自适应先验的规划

Álvaro Serra-Gomez, Daniel Jarne Ornia, Dhruva Tirumala, Thomas Moerland

机构 * LIACS, Leiden University, Leiden, The Netherlands(莱顿大学莱顿分校,荷兰) Google Deepmind, London, United Kingdom(谷歌DeepMind,英国伦敦) University of Oxford, Oxford, United Kingdom(牛津大学,英国牛津)

专题命中 模型式强化学习 :model-based reinforcement learning(abstract);分类 cs.AI、cs.LG、cs.RO

AI总结 本文提出了一种基于KL正则化的学习规划框架,通过将规划器的动作分布作为先验整合到策略优化中,提升了在高维连续控制任务中模型驱动强化学习的样本效率和长期性能。

Comments Published at ICML2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.14220 2026-05-22 cs.LG cs.AI 56%

Twice Sequential Monte Carlo for Tree Search

两次序贯蒙特卡洛用于树搜索

Yaniv Oren, Joery A. de Vries, Pascal R. van der Vaart, Matthijs T. J. Spaan, Wendelin Böhmer

机构 * Delft University of Technology(代尔夫特理工大学)

专题命中 模型式强化学习 :model-based reinforcement learning(abstract);分类 cs.AI、cs.LG

AI总结 本文提出Twice Sequential Monte Carlo Tree Search(TSMCTS)方法,通过减少方差和缓解路径退化问题,提高了在离散和连续环境中比SMC基线和现代MCTS版本更优的性能,同时在顺序计算上具有良好的扩展性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.21805 2026-05-22 stat.CO cs.LG stat.ML 50%

Truncated Neural Likelihood Estimation for Simulation-Based Inference in State-Space Models

截断神经似然估计用于状态空间模型中的基于模拟的推断

Kostas Tsampourakis, Víctor Elvira

机构 * School of Mathematics, University of Edinburgh(爱丁堡大学数学学院)

专题命中 模型式强化学习 :latent dynamics(abstract);分类 cs.LG

AI总结 本文提出了一种改进的截断神经似然估计(T-SNL)方法,解决了传统序列神经似然(SNL)在状态空间模型中推断时存在的样本需求大、扩展性差和不可 amortization 的问题,从而提高了推断的准确性、稳定性与鲁棒性。

详情

展开后加载摘要…

URL PDF HTML 收藏