Vlaser: Vision-Language-Action Model with Synergistic Embodied Reasoning
Vlaser:具有协同具身推理能力的视觉-语言-动作模型
机构 * University of Science and Technology of China(中国科学技术大学) ; Shanghai AI Laboratory(上海人工智能实验室) ; Shanghai Jiao Tong University(上海交通大学) ; Zhejiang University(浙江大学) ; Nanjing University(南京大学) ; Fudan University(复旦大学) ; Tsinghua University(清华大学) ; NUS(新加坡国立大学) ; Northeastern University(东北大学) ; Shenzhen University(深圳大学)
AI总结 Vlaser通过整合高级推理与低级控制,解决了具身推理与VLA策略学习之间的关键差距,在多个基准测试中取得最佳性能。