Open-Source Multimodal Moxin Models with Moxin-VLM and Moxin-VLA
开源多模态Moxin模型:Moxin-VLM和Moxin-VLA
机构 * Northeastern University(东北大学) ; Harvard University(哈佛大学) ; Cornell University(康奈尔大学) ; Tulane University(路易斯安那州立大学) ; University of Washington(华盛顿大学) ; Futurewei(未来通信) ; AIBAO LLC
专题命中 GUI与屏幕智能体 :VLM(title,abstract);分类 cs.CV、cs.LG
AI总结 本文提出开源多模态Moxin模型,通过Moxin-VLM、Moxin-VLA和Moxin-Chinese三种变体,提升视觉-语言、视觉-语言-动作及中文任务的性能。