Towards Practical World Model-based Reinforcement Learning for Vision-Language-Action Models
面向视觉-语言-动作模型的实用世界模型强化学习
机构 * National Key Laboratory for Novel Software Technology, Nanjing University, Nanjing, China(新型软件技术国家实验室,南京大学,南京,中国) ; School of Artificial Intelligence, Nanjing University, Nanjing, China(人工智能学院,南京大学,南京,中国) ; Mila - Quebec AI Institute(魁北克AI研究所)
专题命中 模仿学习与强化学习 :world model(title,abstract);robotic(abstract);分类 cs.RO、cs.LG
AI总结 本文提出VLA-MBPO框架,解决视觉-语言-动作模型在强化学习中的世界建模、多视角一致性及稀疏奖励下的误差累积问题,提升策略性能和样本效率。