LA4VLA: Learning to Act without Seeing via Language-Action Pretraining
LA4VLA:通过语言-动作预训练实现无视觉行动学习
Tao Lin, Yuxin Du, Yiran Mao, Zewei Ye, Yilei Zhong, Bing Cheng, Yiming Wang, Jiting Liu, Yang Tian, Junchi Yan, Feiran Wu, Zenan Meng, Hu Wei, Yuqian Fu, Gen Li, Bo Zhao
机构
*
School of AI, Shanghai Jiao Tong University(上海交通大学人工智能学院)
;
Alibaba Group(阿里巴巴集团)
;
Nanyang Technological University(南洋理工大学)
;
KAUST(阿卜杜拉国王科技大学)
机构
*
College of Intelligent Robotics and Advanced Manufacturing, Fudan University(复旦大学智能机器人与先进制造学院)
;
School of Data Science and Engineering, East China Normal University(华东师范大学数据科学与工程学院)
机构
*
The University of Tokyo(东京大学)
;
ByteDance Seed(字节跳动 Seed)
;
The University of Hong Kong(香港大学)
;
Shanghai Jiao Tong University(上海交通大学)
;
Tsinghua University(清华大学)
HarnessWAM: Bridging Prediction and Deliberation in World Action Models
HarnessWAM:弥合世界动作模型中的预测与审议差距
Zhaopeng Gu, Bingke Zhu, Tianxi Lin, Guibo Zhu, Yingying Chen, Kai Wang, Tingyu Yuan, Chaoyang Zhao, Zhaowen Li, Peng Su, Jinqiao Wang
机构
*
Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所)
;
School of Artificial Intelligence, University of Chinese Academy of Sciences(中国科学院大学人工智能学院)
;
Yinwang Intelligent Technology Co., Ltd.(银湾智能科技有限公司)
;
Beijing Institute of Technology(北京理工大学)
;
Wuhan AI Research(武汉人工智能研究院)
机构
*
School of Automation, Beijing Institute of Technology(北京理工大学自动化学院)
;
School of Mechanical Engineering, Beijing Institute of Technology(北京理工大学机械工程学院)
机构
*
State Key Laboratory of Multimedia Information Processing, School of Computer Science, Peking University(北京大学计算机学院多媒体信息处理国家重点实验室)
;
Beijing Innovation Center of Humanoid Robotics(北京人形机器人创新中心)
;
Nanyang Technological University(南洋理工大学)
;
Hong Kong University of Science and Technology(香港科技大学)
;
University of Electronic Science and Technology of China(电子科技大学)
机构
*
Fudan University(复旦大学)
;
Shanghai Innovation Institute(上海创新研究院)
;
The University of Hong Kong(香港大学)
;
Tongji University(同济大学)
;
Li Auto Inc.(理想汽车)
;
Huazhong University of Science and Technology(华中科技大学)
;
Imperial College London(伦敦帝国理工学院)
;
University of Surrey(萨里大学)
DreamFly: Causal Memory and Receding-Horizon Diffusion Planning for Aerial Vision-Language Navigation
DreamFly:面向空中视觉语言导航的因果记忆与后退时域扩散规划
Yan Deng, Fei Xu
机构
*
School of Electronic Information Engineering, Xi’an Technological University(西安工业大学电子信息工程学院)
;
School of Computer Science and Engineering, Xi’an Technological University(西安工业大学计算机科学与工程学院)
Embodied Multimodal Grounding for Open-Vocabulary Mobile Manipulation via Semantic 3D Gaussian Splatting
基于语义三维高斯溅射的开放词汇移动操作具身多模态定位
Huosen Ou, Dongni Song, Yuncong Wang, Tao Zhou, Yiding Ji
机构
*
The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州))
;
Midea Group(美的集团)
;
The Hong Kong University of Science and Technology(香港科技大学)