Enhancing End-to-End Autonomous Driving with Risk Semantic Distillaion from VLM
机构 * Tsinghua University(清华大学) ; Laboratories, Huawei Technologies(华为技术有限公司2012实验室)
专题命中 GUI与屏幕智能体 :VLM(title,abstract);vision-language model(abstract);分类 cs.CV
AI 大模型
视觉语言模型、视觉推理、视觉问答、图文理解和视觉 grounding。
机构 * Tsinghua University(清华大学) ; Laboratories, Huawei Technologies(华为技术有限公司2012实验室)
专题命中 GUI与屏幕智能体 :VLM(title,abstract);vision-language model(abstract);分类 cs.CV
专题命中 GUI与屏幕智能体 :VLM(title,abstract);vision-language model(abstract);分类 cs.CV
机构 * Holcombe Department of Electrical and Computer Engineering(霍尔科姆电气与计算机工程系) ; Clemson University(克莱姆森大学)
专题命中 GUI与屏幕智能体 :VLM(title,abstract);vision-language model(abstract);分类 cs.AI
机构 * Google DeepMind(谷歌DeepMind)
专题命中 GUI与屏幕智能体 :VLM(title,abstract);vision-language model(abstract);分类 cs.LG
Comments accepted by PRL Workshop Series @ ICAPS 2025. 11 main body pages, 21 appendix pages
机构 * University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校)
专题命中 GUI与屏幕智能体 :vision language model(title);vision-language model(abstract);VLM(abstract);分类 cs.AI
Comments 12 pages, 10 figures, under review
机构 * Qualcomm AI Research(高通人工智能研究)
专题命中 GUI与屏幕智能体 :VLM(title,abstract);vision-language model(abstract);分类 cs.LG
Comments 19 pages including references, 6 figures. Accepted to CoRL LEAP 2025
专题命中 GUI与屏幕智能体 :VLM(title,abstract);vision-language model(abstract);分类 cs.AI
Comments 10 pages
机构 * CSE Department, HKUST(香港科技大学计算机科学与工程系) ; Tencent AI Lab(腾讯AI实验室) ; Robotics X, Tencent(腾讯机器人实验室) ; University of Pennsylvania(宾夕法尼亚大学)
专题命中 GUI与屏幕智能体 :vision language model(title);vision-language model(abstract);visual question answering(abstract);分类 cs.CV
Comments EMNLP 2025
专题命中 GUI与屏幕智能体 :VLM(title,abstract);vision language model(abstract);分类 cs.AI
机构 * University of Birmingham(伯明翰大学) ; Queen Mary University of London(伦敦大学女王学院) ; Aston University(阿斯顿大学) ; United Kingdom National Nuclear Laboratory Ltd.(英国国家核实验室有限公司)
专题命中 GUI与屏幕智能体 :vision-language model(title,abstract);VLM(abstract);分类 cs.AI
Comments Accepted at Human-Centered Robot Autonomy for Human-Robot Teams (HuRoboT) at IEEE RO-MAN 2025, Eindhoven, the Netherlands
机构 * Spotify Denmark(Spotify丹麦分公司) ; Spotify United Kingdom(Spotify英国分公司)
专题命中 GUI与屏幕智能体 :multimodal large language model(title,abstract);MLLM(abstract);分类 cs.CV
专题命中 GUI与屏幕智能体 :vision-language model(title,abstract);VLM(abstract);分类 cs.CV
Comments The webpage is at https://dex-vla.github.io/. DexVLA is accepted by CoRL 2025
专题命中 GUI与屏幕智能体 :grounding(title,abstract);vision-language model(abstract);分类 cs.CV
机构 * Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所) ; School of Computer Science, Wuhan University(武汉大学计算机学院) ; School of Computer Science, University of Technology Sydney(悉尼大学计算机学院) ; IAIR, Xi’an Jiaotong University(西安交通大学IAIR)
专题命中 GUI与屏幕智能体 :vision-language model(title,abstract);VLM(abstract);分类 cs.CV
Comments 8 pages, 5 figures
Journal ref IROS 2025
机构 * The Harker School, USA(哈克尔学校) ; Dougherty Valley High School, USA(道格拉斯谷高中) ; Kissan.ai, USA(加州大学梅尔德分校) ; University of California, Merced, USA
专题命中 GUI与屏幕智能体 :vision-language model(title,abstract);VLM(abstract);分类 cs.CV
机构 * Holcombe Department of Electrical and Computer Engineering, Clemson University, Clemson, SC, USA(霍尔科姆电气与计算机工程系,克莱姆森大学)
专题命中 GUI与屏幕智能体 :vision-language model(title,abstract);VLM(abstract);分类 cs.AI
专题命中 GUI与屏幕智能体 :multimodal large language model(title,abstract);MLLM(abstract);分类 cs.CV
Comments The authors could not reach a consensus on the final version of this paper, necessitating its withdrawal
专题命中 GUI与屏幕智能体 :vision-language model(title,abstract);VLM(abstract);分类 cs.AI
机构 * Huazhong University of Science and Technology(华中科技大学) ; Ping An Technology (Shenzhen) Co., Ltd.(平安科技(深圳)有限公司)
专题命中 GUI与屏幕智能体 :vision-language model(title);visual language model(abstract);visual question answering(abstract);分类 cs.CV
Comments Accepted by the 63rd Annual Meeting of the Association for Computational Linguistics (ACL 2025)
机构 * School of Artificial Intelligence, Jilin University(吉林大学人工智能学院)
专题命中 GUI与屏幕智能体 :vision-language model(title,abstract);VLM(abstract);分类 cs.AI
机构 * Faculty of Science and Engineering, University of Groningen(工程学院,格罗宁根大学)
专题命中 GUI与屏幕智能体 :vision language model(title,abstract);VLM(abstract);分类 cs.AI
Comments 8 pages, 4 figures
机构 * Rutgers University(罗格斯大学) ; The University of Texas at Austin(德克萨斯大学奥斯汀分校)
专题命中 GUI与屏幕智能体 :VLM(title,abstract);grounding(abstract);分类 cs.AI
专题命中 GUI与屏幕智能体 :vision language model(title,abstract);VLM(abstract);分类 cs.LG
专题命中 GUI与屏幕智能体 :vision language model(title);vision-language model(abstract);VLM(abstract);分类 cs.AI
专题命中 GUI与屏幕智能体 :visual language model(title,abstract);VLM(abstract);分类 cs.CV
Comments CVPR 2024 (Highlight), 27 pages, 19 figures
专题命中 GUI与屏幕智能体 :grounding(title,abstract);multimodal large language model(abstract);分类 cs.CV
专题命中 GUI与屏幕智能体 :vision-language model(title);vision language model(abstract);VLM(abstract);分类 cs.AI
Comments preprint, 9 pages
专题命中 GUI与屏幕智能体 :vision-language model(title,abstract);VLM(abstract);分类 cs.AI
Comments 7 Figures, 2 Tables, 11 Pages
专题命中 GUI与屏幕智能体 :vision-language model(title,abstract);VLM(abstract);分类 cs.CV
Comments 15 pages
Journal ref International Conference on Pattern Recognition and Artificial Intelligence (ICPRAI) 2024
专题命中 GUI与屏幕智能体 :VLM(title,abstract);vision language model(abstract);分类 cs.CV
Comments Accepted by Robotics: Science and Systems (RSS 2024)