Self-Improving VLA Policies: Selected Diffusion Noise for Spurious-Robust Action Smoothing
自我改进的VLA策略:用于抗伪影动作平滑的选择性扩散噪声
Duc Minh Nguyen, Bao-Ngoc Dao, Tung M. Luu, Binh Gia Nguyen, Vinh Tong, Anji Liu, Vu N. Duong, Dung D. Le, Daniel Sonntag, Trung Le, Ngan Le, Jan Peter, An Thai Le, Minh Nhat Vu, Mathias Niepert, Khoa D. Doan, Duy M. H. Nguyen, Vien Anh Ngo
机构
*
Center for AI Research, VinUniversity(VinUniversity人工智能研究中心)
;
VinRobotics
;
KAIST(韩国科学技术院)
;
University of Stuttgart(斯图加特大学)
;
IMPRS-IS(国际马克斯·普朗克智能系统研究学院)
;
National University of Singapore(新加坡国立大学)
;
DFKI(德国人工智能研究中心)
;
University of Oldenburg(奥尔登堡大学)
;
Monash University(莫纳什大学)
;
University of Arkansas(阿肯色大学)
;
TU Darmstadt(达姆施塔特工业大学)
State Backdoor: Towards Stealthy Real-world Poisoning Attack on Vision-Language-Action Model in State Space
状态后门:针对状态空间中视觉-语言-动作模型的隐蔽现实世界投毒攻击
Ji Guo, Wenbo Jiang, Yansong Lin, Yijing Liu, Ruichen Zhang, Guomin Lu, Aiguo Chen, Xinshuo Han, Hongwei Li
机构
*
Laboratory Of Intelligent Collaborative Computing, University of Electronic Science and Technology of China(智能协同计算实验室,电子科学与技术大学)
;
National Key Laboratory of Wireless Communications, University of Electronic Science and Technology of China(无线通信国家重点实验室,电子科学与技术大学)
;
School of Computer Science and Engineering, University of Electronic Science and Technology of China(计算机科学与工程学院,电子科学与技术大学)
;
College of Computer Science and Technology, Nanjing University of Aeronautics and Astronautics(计算机科学与技术学院,南京航空航天大学)
;
College of Computing and Data Science, Nanyang Technological University(计算与数据科学学院,南洋理工大学)
VLAMotor: Test-Guided Enhancement of Vision-Language-Action Models via Agent-BasedData Synthesis
VLAMotor: 通过基于智能体的数据合成实现视觉-语言-动作模型的测试引导增强
Zeqin Liao, Peifan Ren, Zixu Gao, Hongyu Gong, Lianyu Hu, Wenbing Tang, Yuhong Nan, Zibin Zheng, Yang Liu
机构
*
School of computing and data science, Nanyang Technological University(计算与数据科学学院,南洋理工大学)
;
School of Software Engineering, Sun Yat-sen University(软件工程学院,中山大学)
;
GuangDong Engineering Technology Research Center of Blockchain, China(区块链工程技术研发中心,中国)
;
Northwest A&F University(西北农林科技大学)
Ryan Yu, Pushi Zhang, Starrick Liu, Brae Liu, Miracle Kang, Shalfun Li, Lights Shi, Ellie Ma, Ping Yang, Chris Pan, Jerry Chen, Dongxiu Liu, Rain Sun, Miles Guo, Byron Zhang, Hugo Zhou, Zach Xu, Vincent Chen, Harrison Huang, James Wang, Dance Kuzi, Andy Zhai, Hang Su, Roy Gan, Lucy Liang, Hao Wang, Qian Wang
ELAN4D: Embodiment-Centric 4D Supervision for Vision-Language-Action Models via Plug-and-Play Adaptation
ELAN4D:以具身为中心的4D监督用于视觉-语言-动作模型的即插即用适配
Zeyuan He, Bowen Yang, Zhirui Fang, Keru Zhou, Lei Jiang, Jingjing Qian, Fan Mo, Junchi Yan, Philip Torr, Xiu Li, Li Jiang, Jialin Yu
机构
*
Torr Vision Group, University of Oxford(托尔视觉组,牛津大学)
;
The Chinese University of Hong Kong, Shenzhen(香港大学(深圳))
;
Tsinghua University(清华大学)
;
Shanghai Jiao Tong University(上海交通大学)
;
University College London(伦敦大学学院)
;
University of Cambridge(剑桥大学)
机构
*
Tsinghua University(清华大学)
;
Beijing Academy of Artificial Intelligence(北京人工智能研究院)
;
The University of Hong Kong(香港大学)
;
Shanghai Jiao Tong University(上海交通大学)
;
ShanghaiTech University(上海科技大学)
;
Peking University(北京大学)
Clutter-Robust Vision-Language-Action Models through Object-Centric and Geometry Grounding
通过对象中心和几何约束实现抗杂波的视觉-语言-动作模型
Khoa Vo, Taisei Hanyu, Yuki Ikebe, Trong Thang Pham, Nhat Chung, Minh Nhat Vu, Duy Nguyen Ho Minh, Anh Nguyen, Anthony Gunderman, Chase Rainwater, Ngan Le
机构
*
University of Arkansas(阿拉巴马大学)
;
National University of Singapore(新加坡国立大学)
;
TU Wien(维也纳技术大学)
;
Max Planck Research School for Intelligent Systems(智能系统马克斯·普朗克研究学校)
;
University of Stuttgart(斯图加特大学)
;
University of Liverpool(利物浦大学)
DepthCache: Depth-Guided Training-Free Visual Token Merging for Vision-Language-Action Model Inference
DepthCache: 一种基于深度的无训练视觉标记融合方法,用于视觉-语言-动作模型推理
Yuquan Li, Lianjie Ma, Han Ding, Lijun Zhu
机构
*
School of Artificial Intelligence and Automation, Huazhong University of Science and Technology(华中科技大学人工智能与自动化学院)
;
School of Mechanical Science and Engineering, Huazhong University of Science and Technology(华中科技大学机械科学与工程学院)