radio-llava: Advancing Vision-Language Models for Radio Astronomical Source Analysis
专题命中 VLM训练与架构 :vision-language model(title,abstract);LLaVA(title,abstract);VLM(abstract)
Comments 19 pages, 6 figures
AI 大模型
视觉语言模型、视觉推理、视觉问答、图文理解和视觉 grounding。
专题命中 VLM训练与架构 :vision-language model(title,abstract);LLaVA(title,abstract);VLM(abstract)
Comments 19 pages, 6 figures
机构 * S-Lab, Nanyang Technological University(南洋理工大学S实验室) ; BUPT(北京邮电大学) ; ByteDance(字节跳动)
专题命中 VLM训练与架构 :LLaVA(title,abstract);分类 cs.CV
Comments Project page: https://llava-vl.github.io/blog/2024-09-30-llava-video/; Accepted at TMLR
机构 * School of Computer Science and Engineering, Chung-Ang University(Chung-Ang 大学计算机科学与工程学院) ; School of Computer Science, University of Birmingham(布拉德福德大学计算机科学学院)
专题命中 VLM训练与架构 :vision-language model(title,abstract);分类 cs.CV
Comments Accepted to ICCV 2025
机构 * Stanford University(斯坦福大学)
专题命中 VLM训练与架构 :vision-language model(title,abstract);分类 cs.CV
Comments ICCV 2025, project page: https://web.stanford.edu/~markendo/projects/feather
机构 * EEEI, University of the Philippines(电子工程学院,菲律宾大学) ; AI Graduate Program, University of the Philippines(人工智能研究生项目,菲律宾大学)
专题命中 VLM训练与架构 :vision language model(abstract);VLM(abstract);分类 cs.CV
Comments 14 pages, accepted in ICCV 2025 Workshop on RetailVision
机构 * Department of Energy Technology(能源技术系) ; Aalborg University(奥尔堡大学)
专题命中 VLM训练与架构 :vision-language model(abstract);分类 cs.CV、cs.LG
Comments 11 pages, 8 figures
机构 * Cooperative Medianet Innovation Center, Shanghai Jiao Tong University(合作中位网创新中心,上海交通大学) ; School of Artificial Intelligence, Shanghai Jiao Tong University(人工智能学院,上海交通大学) ; Shanghai Innovation Institute(上海创新研究院) ; Shanghai Artificial Intelligence Laboratory(上海人工智能实验室) ; Beijing Institute of Technology(北京理工大学) ; A*STAR Centre for Frontier AI Research(A*STAR前沿人工智能研究中心)
专题命中 VLM训练与架构 :vision-language model(abstract);分类 cs.CV、cs.AI
Comments 16 pages, Accepted at IEEE Transactions on Pattern Analysis and Machine Intelligence (TPAMI)
专题命中 VLM训练与架构 :vision-language model(abstract);分类 cs.CV、cs.LG
Comments To appear in ICCV 2025
机构 * FAIR, Meta(FAIR与Meta公司) ; MIT(麻省理工学院) ; Princeton University(普林斯顿大学) ; New York University(纽约大学)
专题命中 VLM训练与架构 :multimodal large language model(abstract);分类 cs.CV
Comments 10 pages
专题命中 VLM训练与架构 :vision language model(abstract)