arXivDaily arXiv每日学术速递 周一至周五更新

视觉与机器人

世界模型

面向环境建模、时序预测、仿真规划、具身智能和自动驾驶的世界模型方法与应用。

2026-03-24 至 2026-03-24 共收录 2 信号源:cs.AI, cs.LG, cs.CV, cs.RO, cs.MA

1. 模型式强化学习 2 篇

2603.21162 2026-03-24 cs.AI cs.LG 56%

Revisiting Tree Search for LLMs: Gumbel and Sequential Halving for Budget-Scalable Reasoning

重新审视用于大语言模型的树搜索:Gumbel与顺序削减用于可扩展的推理

Leonid Ugadiarov, Yuri Kuratov, Aleksandr Panov, Alexey Skrynnik

专题命中 模型式强化学习 :model-based reinforcement learning(abstract);分类 cs.AI、cs.LG

AI总结 本文提出ReSCALE,通过将Gumbel采样和顺序削减替代传统方法,实现大语言模型在推理中的可扩展推理能力提升,解决了搜索预算增加时准确率下降的问题。

Comments The paper has been accepted to the ICAPS-2026 conference. 5 pages, 2 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.14038 2026-03-24 cs.LG 50%

Sliding Puzzles Gym: A Scalable Benchmark for State Representation in Visual Reinforcement Learning

滑动拼图健身房:一种可扩展的用于视觉强化学习状态表示的基准

Bryan L. M. de Oliveira, Luana G. B. Martins, Bruno Brandão, Murilo L. da Luz, Telma W. de L. Soares, Luckeciano C. Melo

机构 * Advanced Knowledge Center for Immersive Technologies -- AKCIT, Brazil(沉浸式技术高级知识中心 -- AKCIT,巴西) OATML, University of Oxford, United Kingdom(OATML,牛津大学,英国) Institute of Informatics, Federal University of Goiás, Goiânia, Brazil(信息学院,戈亚尼亚联邦大学,巴西)

专题命中 模型式强化学习 :model-based RL(abstract);分类 cs.LG

AI总结 本文提出Sliding Puzzles Gym,通过调整网格大小和图像池来控制视觉表示复杂度,评估视觉表示学习能力,发现现有方法在处理视觉多样性时存在局限。

Comments Accepted at ICML 2025

Journal ref Proceedings of Machine Learning Research 267:12689-12717, 2025

详情

展开后加载摘要…

URL PDF HTML 收藏