Do Vision-Language-Action Models Mean What They Say? On the Role of Faithfulness in Embodied Reasoning
视觉语言动作模型所言即所指?论忠实性在具身推理中的作用
Matthew Foutter, Matteo Cercola, Lena Wild, Yunshan Wang, Michelle Li, Daniele Gammelli, Marco Pavone
机构
*
Stanford University(斯坦福大学)
;
Politecnico di Milano(米兰理工大学)
;
KTH Royal Institute of Technology(皇家理工学院)
;
Italian Institute of Artificial Intelligence (AI4I)(意大利人工智能研究所)
;
NVIDIA Research(英伟达研究院)
Towards Backdoor-Based Ownership Verification for Vision-Language-Action Models
面向视觉-语言-动作模型的后门基于所有权验证
Ming Sun, Rui Wang, Xingrui Yu, Lihua Jing, Hangyu Du, Zhenglin Wan, Xu Pan, Ivor Tsang
机构
*
Institute of Information Engineering, Chinese Academy of Sciences(中国科学院信息工程研究所)
;
School of Cyber Security, University of Chinese Academy of Sciences(中国科学院大学网络安全学院)
;
A*STAR Institute of High Performance Computing (A*STAR IHPC)(新加坡A*STAR高性能计算研究所)
;
A*STAR Centre for Frontier AI Research (A*STAR CFAR)(新加坡A*STAR前沿人工智能研究中心)
;
College of Computing and Data Science, Nanyang Technological University(南洋理工大学计算机与数据科学学院)
;
College of Design and Engineering, Nanyang Technological University(南洋理工大学设计与工程学院)
;
Department of Computer Science, National University of Singapore(新加坡国立大学计算机科学系)
;
State Key Laboratory of Information Engineering in Surveying, Mapping and Remote Sensing (LIESMARS), Wuhan University(武汉大学测绘遥感信息工程国家重点实验室(LIESMARS))
ActDistill: General Action-Guided Self-Derived Distillation for Efficient Vision-Language-Action Models
ActDistill: 通用动作引导自衍生蒸馏用于高效视觉-语言-动作模型
Wencheng Ye, Tianshi Wang, Lei Zhu, Fengling Li, Guoli Yang, Hengtao Shen
机构
*
School of Computer Science and Technology, Tongji University(同济大学计算机科学与技术学院)
;
University of Technology Sydney(悉尼科技大学)
;
Advanced Institute of Big Data(大数据先进研究院)
机构
*
Thomas Lord Department of Computer Science, University of Southern California(南加州大学托马斯·洛德计算机科学系)
;
Sony AI(索尼AI)
;
Sibley School of Mechanical and Aerospace Engineering, Cornell University(康奈尔大学西布利机械与航空航天工程学院)
机构
*
East China Normal University(华东师范大学)
;
Zhongguancun Academy(中关村学院)
;
CFAR, A*STAR, Singapore(新加坡科技研究局CFAR)
;
Tsinghua University(清华大学)
;
Harbin Institute of Technology(哈尔滨工业大学)
机构
*
National Key Laboratory for Novel Software Technology, Nanjing University, Nanjing, China(新型软件技术国家实验室,南京大学,南京,中国)
;
School of Artificial Intelligence, Nanjing University, Nanjing, China(人工智能学院,南京大学,南京,中国)
;
Mila - Quebec AI Institute(魁北克AI研究所)
Action Draft and Verify: A Self-Verifying Framework for Vision-Language-Action Model
动作草稿与验证:一种用于视觉-语言-动作模型的自验证框架
Chen Zhao, Zhuoran Wang, Haoyang Li, Shifeng Bao, Guanlin Li, Youhe Feng, Yang Li, Jie Tang, Jing Zhang
机构
*
Key Laboratory of Data Engineering(数据工程与知识工程重点实验室)
;
Tsinghua University(清华大学)
;
Beijing University of Posts(北京邮电大学)
;
School of Information, Renmin University of China(中国人民大学信息学院)
机构
*
State Key Laboratory of Multimedia Information Processing, School of Computer Science, Peking University(信息多媒体国家重点实验室,计算机科学学院,北京大学)
;
School of Software, Beihang University(软件学院,北航)
;
Beijing Academy of Artificial Intelligence(北京人工智能研究院)
机构
*
Institute of Trustworthy Embodied AI, Fudan University(可信具身AI研究院,复旦大学)
;
Shanghai Key Laboratory of Multimodal Embodied AI(上海多模态具身AI重点实验室)
;
City University of Hong Kong(香港城市大学)
机构
*
Key Laboratory of AI Safety, Institute of Computing Technology, Chinese Academy of Sciences University of Chinese Academy of Sciences(人工智能安全重点实验室,计算技术研究所,中国科学院,中国科学院大学)
机构
*
Department of Civil Engineering, Stony Brook University(土木工程系,石溪大学)
;
Department of Civil and Environmental Engineering, Virginia Tech(土木与环境工程系,弗吉尼亚理工大学)
;
Department of Electrical and Computer Engineering, Virginia Tech(电气与计算机工程系,弗吉尼亚理工大学)
机构
*
Institute of Software, Chinese Academy of Sciences(中国科学院软件研究所)
;
University of Chinese Academy of Sciences(中国科学院大学)
;
LimX Dynamic(LimX动态)
;
Nanjing University(南京大学)
;
Nanyang Technological University(南洋理工大学)
;
Zhejiang University(浙江大学)
专题命中
VLA模型
:vision language action(title);action model(title);vision-language-action(abstract);VLA(abstract)