2510.11027
2026-01-28
cs.CV
57%
Vlaser: Vision-Language-Action Model with Synergistic Embodied Reasoning
Vlaser:具有协同具身推理能力的视觉-语言-动作模型
Ganlin Yang, Tianyi Zhang, Haoran Hao, Weiyun Wang, Yibin Liu, Dehui Wang, Guanzhou Chen, Zijian Cai, Junting Chen, Weijie Su, Wengang Zhou, Yu Qiao, Jifeng Dai, Jiangmiao Pang, Gen Luo, Wenhai Wang, Yao Mu, Zhi Hou
机构
*
University of Science and Technology of China(中国科学技术大学)
;
Shanghai AI Laboratory(上海人工智能实验室)
;
Shanghai Jiao Tong University(上海交通大学)
;
Zhejiang University(浙江大学)
;
Nanjing University(南京大学)
;
Fudan University(复旦大学)
;
Tsinghua University(清华大学)
;
NUS(新加坡国立大学)
;
Northeastern University(东北大学)
;
Shenzhen University(深圳大学)
专题命中
具身推理
:embodied agent(abstract);分类 cs.CV
AI总结
Vlaser通过整合高级推理与低级控制,解决了具身推理与VLA策略学习之间的关键差距,在多个基准测试中取得最佳性能。