ST4VLA: Spatially Guided Training for Vision-Language-Action Models
ST4VLA:基于空间引导的视觉-语言-动作模型训练
Jinhui Ye, Fangjing Wang, Ning Gao, Junqiu Yu, Yangkun Zhu, Bin Wang, Jinyu Zhang, Weiyang Jin, Yanwei Fu, Feng Zheng, Yilun Chen, Jiangmiao Pang
机构
*
Shanghai AI Laboratory(上海人工智能实验室)
;
The Hong Kong University of Science and Technology(香港科技大学)
;
Southern University of Science and Technology(南方科技大学)
;
Fudan University(复旦大学)
An Anatomy of Vision-Language-Action Models: From Modules to Milestones and Challenges
视觉-语言-动作模型的解剖:从模块到里程碑与挑战
Chao Xu, Suyu Zhang, Yang Liu, Baigui Sun, Weihong Chen, Bo Xu, Qi Liu, Juncheng Wang, Shujun Wang, Shan Luo, Jan Peters, Athanasios V. Vasilakos, Stefanos Zafeiriou, Jiankang Deng
机构
*
IROOTECH TECHNOLOGY(IROOTECH技术公司)
;
Wolf 1069 b Lab, Sany Group(Sany集团沃尔夫1069b实验室)
;
Department of Engineering, King’s College London(伦敦国王学院工程系)
;
Hong Kong Polytechnic University(香港理工大学)
;
Computer Science Department of the Technische Universität Darmstadt(德累斯顿技术大学计算机科学系)
;
Department of ICT and Center for AI Research, University of Agder (UiA)(阿格德大学信息与通信技术系及人工智能研究中心)
;
Department of Computing, Imperial College London(伦敦帝国理工学院计算系)
CommentsAccepted by IEEE Robotics and Automation Letters (RA-L), 2026. This version includes an extended appendix with additional implementation details, deployment analysis, robustness evaluation, and real-world evaluation protocol. DOI: 10.1109/LRA.2026.3726379
AnyCamVLA: Zero-Shot Camera Adaptation for Viewpoint Robust Vision-Language-Action Models
AnyCamVLA: 零样本相机适应用于视角鲁棒的视觉-语言-动作模型
Hyeongjun Heo, Seungyeon Woo, Sang Min Kim, Junho Kim, Junho Lee, Yonghyeon Lee, Young Min Kim
机构
*
Department of Electrical and Computer Engineering, Seoul National University(电子与计算机工程系,首尔国立大学)
;
Department of Mechanical Engineering, Massachusetts Institute of Technology(机械工程系,麻省理工学院)
XR-1: Towards Versatile Vision-Language-Action Models via Learning Unified Vision-Motion Representations
XR-1:通过学习统一的视觉-运动表示实现多功能的视觉-语言-动作模型
Shichao Fan, Kun Wu, Zhengping Che, Xinhua Wang, Di Wu, Fei Liao, Ning Liu, Yixue Zhang, Zhen Zhao, Zhiyuan Xu, Meng Li, Qingjie Liu, Shanghang Zhang, Min Wan, Jian Tang
机构
*
Beijing Innovation Center of Humanoid Robotics, Beijing, China(北京人形机器人创新中心,北京,中国)
;
School of Mechanical Engineering and Automation, Beihang University, Beijing, China(北京航空航天大学机械工程及自动化学院,北京,中国)
;
State Key Laboratory of Virtual Reality Technology and Systems, SCSE, Beihang University, Beijing, China(虚拟现实技术与系统国家重点实验室,SCSE,北京航空航天大学,北京,中国)
;
State Key Laboratory of Multimedia Information Processing, School of Computer Science, Peking University, Beijing, China(多媒体信息处理国家重点实验室,计算机科学学院,北京大学,北京,中国)
Adaptive Action Chunking at Inference-time for Vision-Language-Action Models
推理时的自适应动作分块
Yuanchang Liang, Xiaobo Wang, Kai Wang, Shuo Wang, Xiaojiang Peng, Haoyu Chen, David Kim Huat Chua, Prahlad Vadakkepat
机构
*
National University of Singapore(新加坡国立大学)
;
Shenzhen University of Advanced Technology(深圳理工大学)
;
Sangfor Technologies Inc.(深信服科技股份有限公司)
;
Mininglamp Technology(明略科技)
;
Shenzhen Technology University(深圳技术大学)
;
City University of Hong Kong(香港城市大学)
Concept-Based Dictionary Learning for Inference-Time Safety in Vision Language Action Models
基于概念的词典学习用于推理时的安全性在视觉语言动作模型中
Siqi Wen, Shu Yang, Shaopeng Fu, Jingfeng Zhang, Lijie Hu, Di Wang
机构
*
Beijing Jiaotong University(北京交通大学)
;
Provable Responsible AI and Data Analytics (PRADA) Lab(可证责任AI与数据分析实验室)
;
King Abdullah University of Science and Technology(国王 Abdullah 科学技术大学)
;
University of Auckland(奥克兰大学)
;
RIKEN Center for Advanced Intelligence Project (AIP)(理化学研究所高级智能项目中心)
;
Mohamed bin Zayed University of Artificial Intelligence (MBZUAI)(穆罕默德·本·扎耶德人工智能大学)
专题命中
VLA模型
:vision language action(title,abstract);action model(title);VLA(abstract);分类 cs.RO