机构
*
School of Computer Science, Shanghai Jiao Tong University(上海交通大学计算机科学学院)
;
Computer Science, King Abdullah University of Science and Technology(阿卜杜拉国王科技大学计算机科学学院)
Action QFormer: Structured Representation Shaping under Action Supervision in Vision-Language-Action Models
动作QFormer:视觉-语言-动作模型中动作监督下的结构化表示塑造
Yufeng Ji, Wenhao Tang, Haoyi Niu, Koushil Sreenath, Yi Wu, Zhongyu Li
机构
*
Shanghai Qizhi Institute(上海期智研究院)
;
The Chinese University of Hong Kong(香港中文大学)
;
Hong Kong Embodied AI Lab(香港具身人工智能实验室)
;
Tsinghua University(清华大学)
;
University of California, Berkeley(加州大学伯克利分校)
机构
*
State Key Laboratory of Multimedia Information Processing, School of Computer Science, Peking University(北京大学计算机科学学院多媒体信息处理技术国家重点实验室)
;
AI 2 Robotics(人工智能与机器人研究所)
;
Sun Yat-sen University(中山大学)
;
Beihang University(北京航空航天大学)
NebulaVLA: A Dual-Frequency Vision-Language-Action Model With Guide Action for Robotic Manipulation
NebulaVLA:用于机器人操纵的带引导动作的双频视觉-语言-动作模型
Cong Zhao, Shuai Tian, Xu Zhang, Baocheng Ni, Xinguo Song, Xueying Sun, Shu Jiang, Shouchang Yang, Bo Tang, Jin Deng, Ge Zhu, YongCheng Wang, Jin Xu, Ri Yang