EXPO-FT: Sample-Efficient Reinforcement Learning Finetuning for Vision-Language-Action Models
EXPO-FT:面向视觉-语言-动作模型的样本高效强化学习微调
机构 * Stanford University(斯坦福大学)
AI总结 提出EXPO-FT系统,通过样本高效的强化学习微调预训练的VLA策略,在多种高精度操作任务中实现完美性能(30/30成功率),平均仅需19.1分钟在线机器人数据。
作者
Robotics / Machine Learning
EXPO-FT:面向视觉-语言-动作模型的样本高效强化学习微调
机构 * Stanford University(斯坦福大学)
AI总结 提出EXPO-FT系统,通过样本高效的强化学习微调预训练的VLA策略,在多种高精度操作任务中实现完美性能(30/30成功率),平均仅需19.1分钟在线机器人数据。