mimic-video: Video-Action Models for Generalizable Robot Control Beyond VLAs
mimic-video: 用于超越VLAs的通用机器人控制的视频-动作模型
机构 * mimic robotics ; Microsoft Zurich(微软瑞士分公司) ; ETH Zurich(苏黎世联邦理工学院) ; ETH AI Center(苏黎世联邦理工学院人工智能中心) ; UC Berkeley(伯克利大学)
AI总结 mimic-video通过结合预训练的视频模型和基于流匹配的动作解码器,实现了更有效的机器人控制,提升了样本效率和收敛速度。
Comments Revised Introduction, Related Work, and Appendix. Additional minor notational and grammatical fixes