Physical Intelligence, Ali Amin, Raichelle Aniceto, Ashwin Balakrishna, Kevin Black, Ken Conley, Grace Connors, James Darpinian, Karan Dhabalia, Jared DiCarlo, Danny Driess, Michael Equi, Adnan Esmail, Yunhao Fang, Chelsea Finn, Catherine Glossop, Thomas Godden, Ivan Goryachev, Lachy Groom, Hunter Hancock, Karol Hausman, Gashon Hussein, Brian Ichter, Szymon Jakubczak, Rowan Jen, Tim Jones, Ben Katz, Liyiming Ke, Chandra Kuchi, Marinda Lamb, Devin LeBlanc, Sergey Levine, Adrian Li-Bell, Yao Lu, Vishnu Mano, Mohith Mothukuri, Suraj Nair, Karl Pertsch, Allen Z. Ren, Charvi Sharma, Lucy Xiaoyang Shi, Laura Smith, Jost Tobias Springenberg, Kyle Stachowicz, Will Stoeckle, Alex Swerdlow, James Tanner, Marcel Torne, Quan Vuong, Anna Walling, Haohuan Wang, Blake Williams, Sukwon Yoo, Lili Yu, Ury Zhilinsky, Zhiyuan Zhou
Expertise need not monopolize: Action-Specialized Mixture of Experts for Vision-Language-Action Learning
Weijie Shen, Yitian Liu, Yuhao Wu, Zhixuan Liang, Sijia Gu, Dehui Wang, Tian Nian, Lei Xu, Yusen Qin, Jiangmiao Pang, Xinping Guan, Xiaokang Yang, Yao Mu
机构
*
MoE key Lab of Artificial Intelligence, AI Institute, Shanghai Jiao Tong University(人工智能混合专家实验室,人工智能研究所,上海交通大学)
;
School of Automation and Intelligent Sensing, Shanghai Jiao Tong University(自动化与智能感知学院,上海交通大学)
;
School of Computer Science, Shanghai Jiao Tong University(计算机科学学院,上海交通大学)
;
Shanghai AI Laboratory(上海人工智能实验室)
;
Tsinghua Shenzhen International Graduate School, Tsinghua University(清华大学深圳国际研究生院,清华大学)
;
The University of Hong Kong(香港大学)
;
Tongji University(同济大学)
;
D-Robotics
;
Key Laboratory of System Control and Information Processing, Ministry of Education of China(系统控制与信息处理重点实验室,中华人民共和国教育部)
;
Shanghai Key Laboratory of Integrated Administration Technologies for Information Security(上海信息安全管理集成技术重点实验室)
机构
*
Shanghai AI Lab(上海人工智能实验室)
;
College of Computer Science and Technology, Zhejiang University(浙江大学计算机科学与技术学院)
;
MMLab, The Chinese University of Hong Kong(香港中文大学MMLab)
;
Peking University(北京大学)
;
SenseTime Research(商汤科技研究院)
;
Tsinghua University(清华大学)
;
HKISI, CAS(中国科学院香港中文大学研究所)
Align-Then-stEer: Adapting the Vision-Language Action Models through Unified Latent Guidance
Yang Zhang, Chenwei Wang, Ouyang Lu, Yuan Zhao, Yunfei Ge, Zhenglong Sun, Xiu Li, Chi Zhang, Chenjia Bai, Xuelong Li
机构
*
Institute of Artificial Intelligence, China Telecom(中国电信人工智能研究院)
;
Tsinghua University(清华大学)
;
The Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳))
;
Northwestern Polytechnical University(西北工业大学)
机构
*
Institute for Interdisciplinary Information Sciences, Tsinghua University,Beijing, China(信息科学交叉研究所,清华大学,北京,中国)
;
Shanghai Qi Zhi Institute, Shanghai, China(上海启智研究院,上海,中国)
机构
*
Tsinghua Shenzhen International Graduate School, Tsinghua University(清华大学深圳国际研究生院,清华大学)
;
School of Electrical and Electronic Engineering, Nanyang Technological University(南洋理工大学电子与电气工程学院)
Mobility VLA: Multimodal Instruction Navigation with Long-Context VLMs and Topological Graphs
Hao-Tien Lewis Chiang, Zhuo Xu, Zipeng Fu, Mithun George Jacob, Tingnan Zhang, Tsang-Wei Edward Lee, Wenhao Yu, Connor Schenck, David Rendleman, Dhruv Shah, Fei Xia, Jasmine Hsu, Jonathan Hoech, Pete Florence, Sean Kirmani, Sumeet Singh, Vikas Sindhwani, Carolina Parada, Chelsea Finn, Peng Xu, Sergey Levine, Jie Tan