StreamPI: Streaming Multimodal Temporal Modeling for Vision-Language-Action Models
StreamPI:面向视觉-语言-动作模型的流式多模态时序建模
机构 * The University of Hong Kong(香港大学) ; ACE Robotics(ACE机器人公司)
专题命中 VLA模型 :VLA(summary_cn,abstract);vision-language-action(title,abstract);action model(title);分类 cs.CV
AI总结 本文提出StreamPI框架,为单帧VLA模型赋予时序推理能力,通过指令锚定时序建模、随机间隔流式训练等方法,在真实机器人与仿真基准任务上性能优于pi0.5。