GlanceWAM: Sparse Test-Time Imagination for World-Action Models
GlanceWAM:面向世界-动作模型的稀疏测试时想象方法
机构 * Virginia Tech(弗吉尼亚理工大学) ; Drexel University(卓克索大学) ; Northeastern University(东北大学) ; Purdue University(普渡大学)
专题命中 视频扩散模型 :video generation(abstract);分类 cs.CV
AI总结 该研究提出GlanceWAM,通过异步解耦视频DiT的想象与控制,打破世界-动作模型的速度-成功率困境,在RoboCasa、LIBERO基准测试中表现优异,推理速度达48ms/块。