ROSBag MCP Server: Analyzing Robot Data with LLMs for Agentic Embodied AI Applications
专题命中 GUI与屏幕智能体 :VLM(abstract);分类 cs.AI
AI 大模型
视觉语言模型、视觉推理、视觉问答、图文理解和视觉 grounding。
专题命中 GUI与屏幕智能体 :VLM(abstract);分类 cs.AI
机构 * The Hong Kong University of Science and Technology (Guangzhou)(香港科学与技术大学(广州)) ; University of Oxford(牛津大学) ; Xi’an Jiaotong University(西安交通大学) ; The Hong Kong University of Science and Technology(香港科学与技术大学) ; City University of Hong Kong(香港城市大学) ; Beijing University of Technology(北京理工大学) ; Duke University(杜克大学) ; X-Humanoid Project(X-Humanoid 项目)
专题命中 GUI与屏幕智能体 :multimodal large language model(abstract);分类 cs.CV