Learning to Accelerate Vision-Language-Action Models through Adaptive Visual Token Caching
通过自适应视觉令牌缓存学习加速视觉-语言-动作模型
Yujie Wei, Jiahan Fan, Jiyu Guo, Ruichen Zhen, Rui Shao, Xiu Su, Zeke Xie, Shuo Yang
机构
*
Harbin Institute of Technology(哈尔滨工业大学)
;
Harbin Institute of Technology, Shenzhen(哈尔滨工业大学(深圳))
;
Meituan Academy of Robotics Shenzhen, Meituan(美团机器人深圳研究院)
;
Central South University(中南大学)
;
HKUST(GZ)(香港科技大学(广州))
Inject Once Survive Later: Backdooring Vision-Language-Action Models to Persist Through Downstream Fine-tuning
一次注入,后期存活:向视觉-语言-动作模型注入后门以在下游微调中持续存在
Jianyi Zhou, Yujie Wei, Ruichen Zhen, Bo Zhao, Xiaobo Xia, Rui Shao, Xiu Su, Shuo Yang
机构
*
Harbin Institute of Technology, Shenzhen(哈尔滨工业大学(深圳))
;
Harbin Institute of Technology(哈尔滨工业大学)
;
Meituan Academy of Robotics Shenzhen, Meituan(美团机器人深圳研究院)
;
Shanghai Jiaotong University(上海交通大学)
;
National University of Singapore(新加坡国立大学)
;
Central South University(中南大学)
机构
*
Tsinghua University(清华大学)
;
Peking University(北京大学)
;
Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所)
;
Carnegie Mellon University(卡内基梅隆大学)
;
Infinigence AI
;
Zhongguancun Academy(中关村学院)
Benchmarking the Generality of Vision-Language-Action Models
对视觉-语言-动作模型通用性的基准测试
Pranav Guruprasad, Sudipta Chowdhury, Harsh Sikka, Mridul Sharma, Helen Lu, Sean Rivera, Aryan Khurana, Hangliang Ren, Yangyue Wang
机构
*
Manifold Research
;
Metarch AI
;
Georgia Tech(佐治亚理工学院)
;
Tufts University(塔夫茨大学)
;
Northeastern University(东北大学)
;
Birla Institute of Technology and Science, Pilani(比拉理工学院,帕利尼)
;
Institute for Research and Innovation in Intelligent Systems (IRIIS)(智能系统研究与创新研究所)
专题命中
VLA模型
:action model(title,abstract);vision-language-action(title);vision language action(abstract);分类 cs.LG
Token Expand-Merge: Training-Free Token Compression for Vision-Language-Action Models
令牌扩展-合并:面向视觉-语言-动作模型的免训练 令牌压缩
Yifan Ye, Jiaqi Ma, Jun Cen, Zhihe Lu
机构
*
College of Science and Engineering, Hamad Bin Khalifa University(1 科学与工程学院,哈马德·本·卡西姆大学)
;
Mohamed bin Zayed University of Artificial Intelligence(2 摩萨·本·扎耶德人工智能大学)
;
College of Computer Science and Technology, Zhejiang University(3 计算机科学与技术学院,浙江大学)
Vision-Language-Action Models for Selective Robotic Disassembly: A Case Study on Critical Component Extraction from Desktops
面向选择性机器人拆解的视觉-语言-动作模型:以从台式机中提取关键部件的案例研究
Chang Liu, Sibo Tian, Sara Behdad, Xiao Liang, Minghui Zheng
机构
*
J. Mike Walker ’66 Department of Mechanical Engineering, Texas A&M University(J. Mike Walker ’66 机械工程系,德克萨斯A&M大学)
;
Engineering School of Sustainable Infrastructure & Environment, University of Florida(可持续基础设施与环境工程学院,佛罗里达大学)
;
Zachry Department of Civil and Environmental Engineering, Texas A&M University(土木与环境工程系,德克萨斯A&M大学)
机构
*
The Institute of Robotics and Automatic Information System(机器人与自动信息系统研究所)
;
Tianjin Key Laboratory of Intelligent Robotics(智能机器人天津重点实验室)
;
TBI Center, Nankai University, Tianjin 300350, China(南开大学天津中心)
;
Faculty of Robot Science and Engineering, Northeastern University, Shenyang 110819, China(机器人科学与工程学院)
;
The State Key Laboratory of Internet of Things for Smart City(智能城市物联网国家重点实验室)
;
Centre for Artificial Intelligence(人工智能中心)
;
Department of Electromechanical Engineering, University of Macau, Macau SAR, China(机电工程系,澳门大学)
机构
*
The Hong Kong University of Science and Technology (Guangzhou)(香港科学与技术大学(广州))
;
University of Oxford(牛津大学)
;
Xi’an Jiaotong University(西安交通大学)
;
The Hong Kong University of Science and Technology(香港科学与技术大学)
;
City University of Hong Kong(香港城市大学)
;
Beijing University of Technology(北京理工大学)
;
Duke University(杜克大学)
;
X-Humanoid Project(X-Humanoid 项目)
专题命中
VLA模型
:vision language action(title,abstract);action model(title,abstract);分类 cs.CV
Spatial Forcing: Implicit Spatial Representation Alignment for Vision-language-action Model
Fuhao Li, Wenxuan Song, Han Zhao, Jingbo Wang, Pengxiang Ding, Donglin Wang, Long Zeng, Haoang Li
机构
*
The Hong Kong University of Science and Technology (Guangzhou)(香港科学与技术大学(广州))
;
Tsinghua University(清华大学)
;
Westlake University(西湖大学)
;
Zhejiang University(浙江大学)
;
South China University of Technology(华南理工大学)
RoVer: Robot Reward Model as Test-Time Verifier for Vision-Language-Action Model
Mingtong Dai, Lingbo Liu, Yongjie Bai, Yang Liu, Zhouxia Wang, Rui SU, Chunjie Chen, Liang Lin, Xinyu Wu
机构
*
Shenzhen Institute of Advanced Technology, Chinese Academy of Sciences(中国科学院深圳先进技术研究所)
;
Peng Cheng Laboratory(鹏城实验室)
;
School of Computer Science and Engineering, Sun Yat-sen University(中山大学计算机科学与工程学院)
;
College of Computing and Data Science, Nanyang Technological University(南洋理工大学计算与数据科学学院)
;
Shanghai AI Laboratory(上海人工智能实验室)
;
University of Chinese Academy of Sciences(中国科学院大学)
;
X-Era AI Lab(X-Era人工智能实验室)
SeqVLA: Sequential Task Execution for Long-Horizon Manipulation with Completion-Aware Vision-Language-Action Model
Ran Yang, Zijian An, Lifeng ZHou, Yiming Feng
机构
*
Virginia Seafood Agricultural Research and Extension Center, and Department of Biological Systems Engineering, Virginia Tech(弗吉尼亚海产品农业研究中心及生物系统工程系,弗吉尼亚理工学院)
;
Department of Electrical and Computer Engineering, Drexel University(电气与计算机工程系,德雷塞尔大学)
A Survey on Vision-Language-Action Models: An Action Tokenization Perspective
Yifan Zhong, Fengshuo Bai, Shaofei Cai, Xuchuan Huang, Zhang Chen, Xiaowei Zhang, Yuanfei Wang, Shaoyang Guo, Tianrui Guan, Ka Nam Lui, Zhiquan Qi, Yitao Liang, Yuanpei Chen, Yaodong Yang
机构
*
Institute for AI, Peking University(人工智能研究院,北京大学)
;
PKU-PsiBot Joint Lab(北京大学PsiBot联合实验室)
;
School of Computer Science, Peking University(北京大学计算机学院)
RationalVLA: A Rational Vision-Language-Action Model with Dual System
Wenxuan Song, Jiayi Chen, Wenxue Li, Xu He, Han Zhao, Can Cui, Pengxiang Ding Shiyan Su, Feilong Tang, Xuelian Cheng, Donglin Wang, Zongyuan Ge, Xinhu Zheng, Zhe Liu, Hesheng Wang, Haoang Li
机构
*
The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州))
;
Westlake University(西湖大学)
;
Monash University(墨尔本大学)
;
Shanghai Jiao Tong University(上海交通大学)