Vision-Language Cross-Attention for Real-Time Autonomous Driving
机构 * Cyrion Labs(Cyrion实验室)
专题命中 VLM训练与架构 :vision-language model(abstract);分类 cs.CV、cs.AI、cs.LG
Comments 5 pages
AI 大模型
视觉语言模型、视觉推理、视觉问答、图文理解和视觉 grounding。
机构 * Cyrion Labs(Cyrion实验室)
专题命中 VLM训练与架构 :vision-language model(abstract);分类 cs.CV、cs.AI、cs.LG
Comments 5 pages
机构 * Dept. of HCI(人机交互系) ; Cyrion Labs(Cyrion实验室)
专题命中 VLM训练与架构 :VLM(abstract);分类 cs.CV、cs.AI、cs.LG
Comments 6 pages
机构 * Department of Electrical and Electronic Engineering, The University of Hong Kong(香港大学电子与电气工程系) ; School of Computing, National University of Singapore(新加坡国立大学计算机学院) ; NVIDIA Research(NVIDIA研究)
专题命中 VLM训练与架构 :vision-language model(abstract);分类 cs.AI、cs.LG
Comments 15 pages, 13 figures
机构 * Samsung Semiconductor, Inc.(三星半导体公司)
专题命中 VLM训练与架构 :vision language model(abstract);分类 cs.AI、cs.LG
机构 * Minzu University of China(民族大学) ; City University of Macau(澳门城市大学) ; Key Laboratory of Computing Power Network and Information Security, Ministry of Education, Shandong Computer Science Center (National Supercomputer Center in Jinan), Qilu University of Technology (Shandong Academy of Sciences)(计算能力网络与信息安全重点实验室,教育部,山东计算机科学中心(济南国家超级计算机中心),齐鲁工业大学(山东省科学院)) ; The University of Adelaide(阿德莱德大学)
专题命中 VLM训练与架构 :grounding(abstract);分类 cs.AI
Comments 16 pages, 13 figures
机构 * Nagoya University(名古屋大学)
专题命中 VLM训练与架构 :multimodal large language model(abstract);分类 cs.CV
Comments ACM Multimedia Asia 2025
机构 * University of North Carolina at Chapel Hill(北卡罗来纳大学教堂山分校) ; Arizona State University(亚利桑那州立大学) ; Michigan State University(密歇根州立大学) ; Honda Research Institute USA(本田美国研究院)
专题命中 VLM训练与架构 :LLaVA(abstract);分类 cs.CV
Comments Accepted as a main conference paper at EMNLP 2025. 9 pages (main content), 7 figures
机构 * Sharif University of Technology(谢里夫科技大学)
专题命中 VLM训练与架构 :vision-language model(abstract);分类 cs.CV
Comments Published at TMLR (102 pages, 10 figures, 17 tables)
机构 * School of Cyberspace Science and Technology, Beijing Institute of Technology(信息空间科学与技术学院,北京理工大学) ; School of Information Engineering, Minzu University of China(信息工程学院,民族大学) ; Australian Institute of Machine Learning, The University of Adelaide(澳大利亚机器学习研究所,阿德莱德大学)
专题命中 其他VLM :multimodal large language model(abstract);分类 cs.AI、cs.LG
机构 * University of Science and Technology of China(中国科学技术大学) ; NLPR & MAIS, Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所) ; School of Artificial Intelligence, University of Chinese Academy of Sciences(中国科学院大学人工智能学院)
专题命中 其他VLM :vision language model(abstract);分类 cs.CV、cs.LG
Comments Accepted by ICCV 2025
机构 * LLM Department, Tencent(腾讯大语言模型部门) ; Peking University(北京大学) ; Nanjing University(南京大学)
专题命中 其他VLM :MLLM(abstract);分类 cs.LG
机构 * University of Pennsylvania(宾夕法尼亚大学) ; Max Planck Institute for Intelligent Systems(马克斯·普朗克智能系统研究所)
专题命中 其他VLM :vision-language model(abstract);分类 cs.CV
机构 * Wuhan University(武汉大学) ; DAMO Academy, Alibaba Group(达摩院,阿里巴巴集团) ; Hupan Lab(虎扑实验室) ; The Chinese University of Hong Kong(香港中文大学) ; Tsinghua University(清华大学) ; Huazhong University of Science and Technology(华中科技大学) ; Zhejiang University(浙江大学)
专题命中 其他VLM :MLLM(abstract)
Comments 13 pages, 6 figures