VLM4VLA: Revisiting Vision-Language-Models in Vision-Language-Action Models
VLM4VLA:重新审视视觉-语言-动作模型中的视觉-语言模型
机构 * Institute for Interdisciplinary Information Sciences, Tsinghua University(清华大学交叉信息研究院) ; Qwen Team, Alibaba Inc.(阿里巴巴公司Qwen团队)
专题命中 VLA模型 :VLA(summary_cn,abstract);vision-language-action(title,abstract);action model(title);分类 cs.CV、cs.AI
AI总结 本文通过VLM4VLA最小适配管道,系统研究视觉-语言模型(VLM)的选择和能力如何影响下游视觉-语言-动作(VLA)策略性能,发现VLM通用能力无法预测下游任务表现,且视觉模块是性能瓶颈。