Developing Vision-Language-Action Model from Egocentric Videos
机构 * Kyoto University(京都大学) ; National Institute of Informatics(国家信息研究所) ; Institute of Science Tokyo(东京科学研究所) ; NII LLMC(日本信息机构语言模型中心) ; Sony Interactive Entertainment(索尼互动娱乐)
专题命中 VLA模型 :vision-language-action(title,abstract);action model(title,abstract);VLA(abstract);分类 cs.RO、cs.AI