PADriver: Towards Personalized Autonomous Driving
机构 * Beijing Institute of Technology(北京理工大学) ; Megvii Technology(商汤科技) ; Waseda University(早稻田大学)
专题命中 GUI与屏幕智能体 :MLLM(abstract);分类 cs.CV
AI 大模型
视觉语言模型、视觉推理、视觉问答、图文理解和视觉 grounding。
机构 * Beijing Institute of Technology(北京理工大学) ; Megvii Technology(商汤科技) ; Waseda University(早稻田大学)
专题命中 GUI与屏幕智能体 :MLLM(abstract);分类 cs.CV
专题命中 GUI与屏幕智能体 :grounding(abstract);分类 cs.CV
机构 * Meituan(美团) ; Zhejiang University(浙江大学) ; University of Adelaide(阿德莱德大学)
专题命中 GUI与屏幕智能体 :grounding(abstract);分类 cs.AI
机构 * Microsoft(微软公司) ; ZJU-UIUC Institute(浙大-伊利诺伊大学联合研究所) ; Nanjing University(南京大学) ; Peking University(北京大学)
专题命中 GUI与屏幕智能体 :multimodal large language model(abstract);分类 cs.AI
Comments The source code of UFO2 is publicly available at https://github.com/microsoft/UFO/, with comprehensive documentation provided at https://microsoft.github.io/UFO/
机构 * McGill University(麦吉尔大学) ; Mila ; Google DeepMind(谷歌DeepMind)
专题命中 GUI与屏幕智能体 :vision-language model(abstract);分类 cs.AI
专题命中 GUI与屏幕智能体 :multimodal large language model(abstract);分类 cs.AI
专题命中 GUI与屏幕智能体 :vision-language model(abstract);分类 cs.CV
Comments Accepted in CVPR-W 2025
专题命中 GUI与屏幕智能体 :grounding(abstract);分类 cs.CV
Comments 8 pages, 5 figures, accepted at IJCNN 2025
专题命中 GUI与屏幕智能体 :VLM(abstract);分类 cs.CV
Comments Accepted to CVPR 2025
专题命中 GUI与屏幕智能体 :vision language model(abstract);分类 cs.CV
Comments Accepted by CVPR 2025, Project website: https://vision.cs.utexas.edu/projects/ProgressCaptioner/
专题命中 GUI与屏幕智能体 :vision-language model(abstract);分类 cs.CV
专题命中 GUI与屏幕智能体 :multimodal large language model(abstract);分类 cs.CV
专题命中 GUI与屏幕智能体 :vision-language model(abstract);分类 cs.AI
专题命中 GUI与屏幕智能体 :vision-language model(abstract);分类 cs.CV
专题命中 GUI与屏幕智能体 :grounding(abstract);分类 cs.CV
Comments ECCV'20 (Spotlight)
专题命中 GUI与屏幕智能体 :MLLM(abstract);分类 cs.AI
Comments Accepted by ICRA 2025
专题命中 GUI与屏幕智能体 :grounding(abstract);分类 cs.CV
Comments 41 pages, 33 Figures
专题命中 GUI与屏幕智能体 :vision-language model(abstract);分类 cs.LG
Comments 20pages,5 figures
专题命中 GUI与屏幕智能体 :VLM(abstract);分类 cs.LG
Comments Accepted to ICLR 2025
专题命中 GUI与屏幕智能体 :MLLM(abstract);分类 cs.CV
Comments 14 pages, 7 figures
专题命中 GUI与屏幕智能体 :vision-language model(abstract);分类 cs.CV
Comments Accepted to ICRA2025
专题命中 GUI与屏幕智能体 :vision-language model(abstract);分类 cs.AI
专题命中 GUI与屏幕智能体 :multimodal large language model(abstract);分类 cs.AI
专题命中 GUI与屏幕智能体 :multimodal large language model(abstract);分类 cs.CV
专题命中 GUI与屏幕智能体 :grounding(abstract);分类 cs.AI
Comments 25pages,12 figures
专题命中 GUI与屏幕智能体 :vision-language model(abstract);分类 cs.CV
专题命中 GUI与屏幕智能体 :vision language model(abstract);分类 cs.CV
Comments Accepted for TENCON 2024
专题命中 GUI与屏幕智能体 :multimodal large language model(abstract);分类 cs.AI
专题命中 GUI与屏幕智能体 :MLLM(abstract);分类 cs.AI
专题命中 GUI与屏幕智能体 :multimodal large language model(abstract);分类 cs.CV