Generate, Transduct, Adapt: Iterative Transduction with VLMs
机构 * University of Massachusetts, Amherst(马萨诸塞大学阿默斯特分校)
专题命中 VLM训练与架构 :vision-language model(abstract);分类 cs.CV
Comments Code is released at https://github.com/cvl-umass/GTA-CLIP
AI 大模型
视觉语言模型、视觉推理、视觉问答、图文理解和视觉 grounding。
机构 * University of Massachusetts, Amherst(马萨诸塞大学阿默斯特分校)
专题命中 VLM训练与架构 :vision-language model(abstract);分类 cs.CV
Comments Code is released at https://github.com/cvl-umass/GTA-CLIP
机构 * University of California, Riverside(加州大学河滨分校)
专题命中 VLM训练与架构 :vision-language model(abstract);分类 cs.LG
Comments Accepted by EMNLP 2024 Findings
机构 * Minzu University of China(民族大学) ; City University of Macau(澳门城市大学) ; Key Laboratory of Computing Power Network and Information Security, Ministry of Education, Shandong Computer Science Center (National Supercomputer Center in Jinan), Qilu University of Technology (Shandong Academy of Sciences)(计算能力网络与信息安全重点实验室,教育部,山东计算机科学中心(济南国家超级计算机中心),齐鲁工业大学(山东省科学院)) ; The University of Adelaide(阿德莱德大学)
专题命中 VLM训练与架构 :grounding(abstract);分类 cs.AI
Comments 16 pages, 13 figures
机构 * Nagoya University(名古屋大学)
专题命中 VLM训练与架构 :multimodal large language model(abstract);分类 cs.CV
Comments ACM Multimedia Asia 2025
机构 * University of North Carolina at Chapel Hill(北卡罗来纳大学教堂山分校) ; Arizona State University(亚利桑那州立大学) ; Michigan State University(密歇根州立大学) ; Honda Research Institute USA(本田美国研究院)
专题命中 VLM训练与架构 :LLaVA(abstract);分类 cs.CV
Comments Accepted as a main conference paper at EMNLP 2025. 9 pages (main content), 7 figures
机构 * Sharif University of Technology(谢里夫科技大学)
专题命中 VLM训练与架构 :vision-language model(abstract);分类 cs.CV
Comments Published at TMLR (102 pages, 10 figures, 17 tables)
机构 * Zhejiang University(浙江大学) ; Shanghai Innovation Institute(上海创新研究院) ; Westlake University(西湖大学) ; Salesforce AI Research(Salesforce AI研究院) ; Columbia University(哥伦比亚大学) ; Rice University(Rice大学)
专题命中 VLM训练与架构 :LLaVA(abstract);分类 cs.CV
Comments code link: https://github.com/cokeshao/HoliTom
专题命中 VLM训练与架构 :MLLM(abstract);分类 cs.CV
Comments Accepted to NeurIPS 2025
机构 * NetoAI
专题命中 VLM训练与架构 :grounding(abstract);分类 cs.AI
Comments Accepted to EMNLP 2025 (Industry Track)
机构 * CUHK(香港中文大学) ; HKUST(香港科技大学) ; HKU(香港大学) ; ByteDance Inc(字节跳动公司)
专题命中 VLM训练与架构 :VLM(abstract);分类 cs.CV
机构 * The University of Tokyo(东京大学) ; Google DeepMind(谷歌DeepMind)
专题命中 VLM训练与架构 :vision language model(abstract);分类 cs.CV
Comments Accepted to NeurIPS2025. Website: https://sites.google.com/view/t2v-dlbs and Code: https://github.com/shim0114/T2V-Diffusion-Search
机构 * School of Electronic Engineering(电子工程学院) ; Xidian University(西安电子科技大学) ; School of Computer Science(计算机科学学院)
专题命中 VLM训练与架构 :vision-language model(abstract);分类 cs.CV
机构 * Sichuan University(四川大学) ; Peking University(北京大学)
专题命中 VLM训练与架构 :multimodal large language model(abstract);分类 cs.CV
机构 * The University of Western Australia(西澳大学) ; Dalian University of Technology(大连理工大学) ; Khalifa University(卡利夫大学) ; Zhejiang Lab(浙江实验室)
专题命中 VLM训练与架构 :multimodal large language model(abstract);分类 cs.CV
机构 * Beijing Academy of Artificial Intelligence (BAAI)(北京人工智能研究院)
专题命中 VLM训练与架构 :LLaVA(abstract);分类 cs.CV
Comments 15 pages
机构 * MAIS, CASIA(中国科学院自动化研究所MAIS实验室) ; Kuaishou Technology(快手科技) ; School of Artificial Intelligence, UCAS(中国科学院大学人工智能学院)
专题命中 VLM训练与架构 :vision-language model(abstract);分类 cs.CV
Comments NeurIPS 2025
机构 * Rochester Institute of Technology(罗切斯特理工大学) ; Bosch Research(博世研究) ; DEVCOM Army Research Laboratory(美国陆军研究实验室)
专题命中 VLM训练与架构 :vision-language model(abstract);分类 cs.CV
Comments Accepted by EMNLP2025
机构 * Visual Recognition Group, Czech Technical University in Prague(捷克技术大学布拉格分校视觉识别组)
专题命中 VLM训练与架构 :VLM(abstract);分类 cs.CV
机构 * Peking University(北京大学) ; AI Geeks ; Australian Artificial Intelligence Institute(澳大利亚人工智能研究所)
专题命中 VLM训练与架构 :MLLM(abstract);分类 cs.CV
机构 * Zhejiang University(浙江大学) ; Westlake University(西湖大学) ; Columbia University(哥伦比亚大学) ; Rice University(Rice大学) ; Salesforce AI Research(Salesforce人工智能研究)
专题命中 VLM训练与架构 :LLaVA(abstract);分类 cs.CV
Comments 12 pages
机构 * Ant Group(蚂蚁集团)
专题命中 VLM训练与架构 :vision-language model(abstract);分类 cs.CV
机构 * State Key Laboratory of Media Convergence and Communication(媒体融合与传播国家重点实验室) ; Communication University of China(中国传媒大学) ; Microsoft Research Asia(微软亚洲研究院)
专题命中 VLM训练与架构 :visual question answering(abstract);分类 cs.AI
机构 * University College London(伦敦大学学院)
专题命中 VLM训练与架构 :vision-language model(abstract);分类 cs.AI
机构 * Peking University(北京大学) ; Tsinghua University(清华大学) ; Mila - Québec AI Institute(魁北克人工智能研究所)
专题命中 VLM训练与架构 :multimodal large language model(abstract);分类 cs.CV
Comments NeurIPS 2025. Code: https://github.com/Gen-Verse/HermesFlow
机构 * School of Computer Science, Wuhan University(武汉大学计算机学院) ; School of Artificial Intelligence, Wuhan University(武汉大学人工智能学院)
专题命中 VLM训练与架构 :multimodal large language model(abstract);分类 cs.LG
专题命中 VLM训练与架构 :grounding(abstract);分类 cs.AI
Comments submitted to AAAI 2026
机构 * NVIDIA(英伟达) ; Rutgers University(罗格斯大学) ; UC Berkeley(加州大学伯克利分校) ; MIT(麻省理工学院) ; Nanjing University(南京大学) ; KAIST(韩国科学技术院)
专题命中 VLM训练与架构 :multimodal large language model(abstract);分类 cs.CV
机构 * Department of Electronic and Computer Engineering, The Hong Kong University of Science and Technology(电子与计算机工程系,香港科学与技术大学)
专题命中 VLM训练与架构 :vision-language model(abstract);分类 cs.CV
Comments Accepted by MICCAI 2025
机构 * School of Computer engineering, Iran university of Science and Technology(计算机工程学院,伊朗科学技术大学)
专题命中 VLM训练与架构 :VLM(abstract);分类 cs.CV
机构 * College of Computing and Data Science, Nanyang Technological University, Singapore(计算与数据科学学院,南洋理工大学,新加坡) ; Business School, University of Seoul, Republic of Korea(商学学院,首尔大学,韩国) ; Alibaba Group and the Alibaba-NTU Joint Research Institute, Singapore(阿里巴巴集团及阿里巴巴-南洋理工大学联合研究机构,新加坡)
专题命中 VLM训练与架构 :grounding(abstract);分类 cs.LG