CommentsWe introduce VLA-Thinker, the first VLA model capable of thinking-with-image reasoning, which models visual perception as a dynamically invocable reasoning action, enabling Multimodal Embodied Chain-of-Thought
Robust Bimanual Vision-Language-Action Models via Embarrassingly Simple Modality Masking
基于极其简单的模态掩码机制的鲁棒双臂视觉-语言-动作模型
Dongzhou Cheng, Ziang Li, Yixiao Zhou, Haojuan Li, Jinghao Zhang, Lei Lei, Minjing Dong, Jie Gui, Jiaqi Wang
机构
*
Shanghai Innovation Institute(上海创新研究院)
;
Wuhan University(武汉大学)
;
Zhejiang University(浙江大学)
;
Shanghai Jiao Tong University(上海交通大学)
;
University of Science and Technology of China(中国科学技术大学)
;
City University of Hong Kong(香港城市大学)
;
Southeast University(东南大学)
NebulaVLA: A Dual-Frequency Vision-Language-Action Model With Guide Action for Robotic Manipulation
NebulaVLA:用于机器人操纵的带引导动作的双频视觉-语言-动作模型
Cong Zhao, Shuai Tian, Xu Zhang, Baocheng Ni, Xinguo Song, Xueying Sun, Shu Jiang, Shouchang Yang, Bo Tang, Jin Deng, Ge Zhu, YongCheng Wang, Jin Xu, Ri Yang
Guide, Think, Act: Interactive Embodied Reasoning in Vision-Language-Action Models
引导、思考、行动:面向视觉-语言-动作模型的交互式具身推理
Yiran Ling, Qing Lian, Jinghang Li, Qing Jiang, Tianming Zhang, Xiaoke Jiang, Chuanxiu Liu, Jie Liu, Lei Zhang
机构
*
Futian Laboratory(福田实验室)
;
Faculty of Computing, Harbin Institute of Technology(哈尔滨工业大学计算机学院)
;
International Digital Economy Academy (IDEA)(国际数字经济学院(IDEA))
;
School of Robotics, Hunan University(湖南大学机器人学院)
;
South China University of Technology(华南理工大学)
;
Visincept(Visincept公司)
;
National Key Laboratory of Smart Farm Technologies and Systems(智能农业技术与系统国家重点实验室)
On the Efficiency of LoRA Fine-Tuning for Vision-Language-Action Models in Industrial Robotic Manipulation
工业机器人操作中视觉语言动作模型的LoRA微调效率研究
Finn Ferchau, Daniel Pommer, Cristian Axenie
机构
*
Technische Hochschule Nürnberg Georg Simon Ohm(纽伦堡乔治·西蒙·欧姆应用技术大学)
;
Siemens AG(西门子股份公司)
;
Fraunhofer Institute for Integrated Circuits (IIS)(弗劳恩霍夫集成电路研究所)
Improving Vision-Language-Action Model Fine-Tuning with Structured Stage and Keyframe Supervision
通过结构化阶段和关键帧监督改进视觉-语言-动作模型微调
Yuan Xu, Yixiang Chen, Kai Wang, Jiabing Yang, Peiyan Li, Qisen Ma, Yan Huang, Liang Wang
机构
*
School of Artificial Intelligence, University of Chinese Academy of Sciences(中国科学院大学人工智能学院)
;
New Laboratory of Pattern Recognition (NLPR), State Key Laboratory of Multimodal Artificial Intelligence Systems (MAIS), Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所模式识别国家重点实验室(NLPR)多模态人工智能系统国家重点实验室(MAIS))
;
FiveAges
Finetuning Vision-Language-Action Models Requires Fewer Layers Than You Think
微调视觉-语言-动作模型所需的层数比你想象的少
Gia-Binh Nguyen, Trong-Bao Ho, Thien-Loc Ha, Khoa Vo, Philip Lund Møller, Quang T. Nguyen, Long Dinh, Tung M. Luu, Tuan Dam, Vu Duong, Trung Le, Nghi D. Q. Bui, Minh Vu, Tran Nguyen Le, An Thai Le, Ngan Le, Daniel Sonntag, James Zou, Jan Peters, Duy M. H. Nguyen, Ngo Anh Vien
机构
*
Center for AI Research, VinUniversity(VinUniversity人工智能研究中心)
;
VinRobotics
;
University of Arkansas(阿肯色大学)
;
Technical University of Denmark(丹麦技术大学)
;
Hanoi University of Science and Technology(河内科技大学)
;
KAIST(韩国科学技术院)
;
Monash University(莫纳什大学)
;
Oldenburg University(奥尔登堡大学)
;
DFKI(德国人工智能研究中心)
;
University of Stuttgart(斯图加特大学)
;
IMPRS-IS(国际马克斯·普朗克智能系统研究学院)
;
Stanford University(斯坦福大学)
;
Technische Universität Darmstadt(达姆施塔特工业大学)