Do What You Say: Steering Vision-Language-Action Models via Runtime Reasoning-Action Alignment Verification
按言行事:通过运行时推理-动作对齐验证引导视觉-语言-动作模型
机构 * NVIDIA(NVIDIA公司) ; Carnegie Mellon University(卡内基梅隆大学) ; University of Utah(犹他大学) ; University of Sydney(悉尼大学)
专题命中 机器人数据与评测 :robotic(abstract);分类 cs.RO、cs.AI、cs.LG
AI总结 通过运行时推理-动作对齐验证方法提升视觉-语言-动作模型的鲁棒性和行为组合能力