SG-WAM: Text-Grounded and Spatial-aware Semantic Guidance for World-Action Models
SG-WAM:面向世界-动作模型的文本 grounded 与空间感知语义引导
机构 * The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州)) ; Ola Dimensions(奥拉维度公司)
专题命中 动作与事件理解 :video generation(abstract);分类 cs.CV
AI总结 针对现有世界-动作模型(WAM)存在的视频与指令语义不对齐问题,提出基于视觉-语言模型(VLM)的SG-WAM语义引导方法,通过注入文本接地且空间感知的语义前瞻,提升了WAM的指令遵循与操纵精度,经仿真和真实实验验证有效。