LLaDA-VLA: Vision Language Diffusion Action Models
机构 * University of Science and Technology of China(中国科学技术大学) ; Nanjing University(南京大学) ; Dexmal Project Page(Dexmal项目页)
专题命中 GUI与屏幕智能体 :vision-language model(abstract);分类 cs.CV
AI 大模型
视觉语言模型、视觉推理、视觉问答、图文理解和视觉 grounding。
机构 * University of Science and Technology of China(中国科学技术大学) ; Nanjing University(南京大学) ; Dexmal Project Page(Dexmal项目页)
专题命中 GUI与屏幕智能体 :vision-language model(abstract);分类 cs.CV