Do What You Say: Steering Vision-Language-Action Models via Runtime Reasoning-Action Alignment Verification
按言行事:通过运行时推理-动作对齐验证引导视觉-语言-动作模型
机构 * NVIDIA(NVIDIA公司) ; Carnegie Mellon University(卡内基梅隆大学) ; University of Utah(犹他大学) ; University of Sydney(悉尼大学)
专题命中 VLA模型 :vision-language-action(title);action model(title);vision language action(abstract);VLA(abstract)
AI总结 通过运行时推理-动作对齐验证方法提升视觉-语言-动作模型的鲁棒性和行为组合能力