Bridging VLMs and Embodied Intelligence with Deliberate Practice Policy Optimization
通过刻意练习策略优化弥合视觉语言模型与具身智能之间的鸿沟
机构 * X-Humanoid ; Imperial College London(帝国理工学院) ; Peking University(北京大学) ; University of Manchester(曼彻斯特大学) ; Westlake University(西湖大学) ; Fudan University(复旦大学) ; Waseda University(早稻田大学) ; Nvidia ; Queen Mary University of London(伦敦大学玛丽女王学院) ; Celonis AI ; Meta AI
AI总结 本文提出DPPO框架,通过监督微调与强化学习交替训练,提升具身智能系统在稀疏数据下的学习效率,并在性能和参数规模上取得显著优势。