Expertise need not monopolize: Action-Specialized Mixture of Experts for Vision-Language-Action Learning
Weijie Shen, Yitian Liu, Yuhao Wu, Zhixuan Liang, Sijia Gu, Dehui Wang, Tian Nian, Lei Xu, Yusen Qin, Jiangmiao Pang, Xinping Guan, Xiaokang Yang, Yao Mu
机构
*
MoE key Lab of Artificial Intelligence, AI Institute, Shanghai Jiao Tong University(人工智能混合专家实验室,人工智能研究所,上海交通大学)
;
School of Automation and Intelligent Sensing, Shanghai Jiao Tong University(自动化与智能感知学院,上海交通大学)
;
School of Computer Science, Shanghai Jiao Tong University(计算机科学学院,上海交通大学)
;
Shanghai AI Laboratory(上海人工智能实验室)
;
Tsinghua Shenzhen International Graduate School, Tsinghua University(清华大学深圳国际研究生院,清华大学)
;
The University of Hong Kong(香港大学)
;
Tongji University(同济大学)
;
D-Robotics
;
Key Laboratory of System Control and Information Processing, Ministry of Education of China(系统控制与信息处理重点实验室,中华人民共和国教育部)
;
Shanghai Key Laboratory of Integrated Administration Technologies for Information Security(上海信息安全管理集成技术重点实验室)
机构
*
Shanghai AI Lab(上海人工智能实验室)
;
College of Computer Science and Technology, Zhejiang University(浙江大学计算机科学与技术学院)
;
MMLab, The Chinese University of Hong Kong(香港中文大学MMLab)
;
Peking University(北京大学)
;
SenseTime Research(商汤科技研究院)
;
Tsinghua University(清华大学)
;
HKISI, CAS(中国科学院香港中文大学研究所)
Align-Then-stEer: Adapting the Vision-Language Action Models through Unified Latent Guidance
Yang Zhang, Chenwei Wang, Ouyang Lu, Yuan Zhao, Yunfei Ge, Zhenglong Sun, Xiu Li, Chi Zhang, Chenjia Bai, Xuelong Li
机构
*
Institute of Artificial Intelligence, China Telecom(中国电信人工智能研究院)
;
Tsinghua University(清华大学)
;
The Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳))
;
Northwestern Polytechnical University(西北工业大学)
机构
*
Institute for Interdisciplinary Information Sciences, Tsinghua University,Beijing, China(信息科学交叉研究所,清华大学,北京,中国)
;
Shanghai Qi Zhi Institute, Shanghai, China(上海启智研究院,上海,中国)
机构
*
Tsinghua Shenzhen International Graduate School, Tsinghua University(清华大学深圳国际研究生院,清华大学)
;
School of Electrical and Electronic Engineering, Nanyang Technological University(南洋理工大学电子与电气工程学院)
Mobility VLA: Multimodal Instruction Navigation with Long-Context VLMs and Topological Graphs
Hao-Tien Lewis Chiang, Zhuo Xu, Zipeng Fu, Mithun George Jacob, Tingnan Zhang, Tsang-Wei Edward Lee, Wenhao Yu, Connor Schenck, David Rendleman, Dhruv Shah, Fei Xia, Jasmine Hsu, Jonathan Hoech, Pete Florence, Sean Kirmani, Sumeet Singh, Vikas Sindhwani, Carolina Parada, Chelsea Finn, Peng Xu, Sergey Levine, Jie Tan
UnderwaterVLA: Dual-brain Vision-Language-Action architecture for Autonomous Underwater Navigation
Zhangyuan Wang, Yunpeng Zhu, Yuqi Yan, Xiaoyuan Tian, Xinhao Shao, Meixuan Li, Weikun Li, Guangsheng Su, Weicheng Cui, Dixia Fan
机构
*
School of Engineering, Westlake University(西lake大学工程学院)
;
College of Information Science & Electronic Engineering, Zhejiang University(浙江大学信息科学与电子工程学院)
;
College of Environmental and Resource Sciences, Zhejiang University(浙江大学环境与资源科学学院)
;
Australian National University(澳大利亚国立大学)
CommentsThis paper introduces the first VLA framework for AUVs, featuring a dual-brain architecture and zero-data MPC for real-world underwater navigation
机构
*
The University of Tokyo(东京大学)
;
ByteDance Seed(字节跳动 Seed)
;
The University of Hong Kong(香港大学)
;
Shanghai Jiao Tong University(上海交通大学)
;
Tsinghua University(清华大学)