dVLA: Diffusion Vision-Language-Action Model with Multimodal Chain-of-Thought
机构 * Midea Group(美的集团) ; Peking University(北京大学) ; Shanghai Jiaotong University(上海交通大学)
专题命中 VLA模型 :vision-language-action(title,abstract);action model(title);VLA(abstract);分类 cs.RO、cs.CV
Comments technique report