VITA-VLA: Efficiently Teaching Vision-Language Models to Act via Action Expert Distillation
机构 * Nanjing University(南京大学) ; Tencent Youtu Lab(腾讯优图实验室) ; CASIA(中国科学院自动化研究所)
专题命中 机器人基础模型 :manipulation(abstract);robotic(abstract);分类 cs.CV
Comments Homepage: https://ltbai.github.io/VITA-VLA/