arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

视觉大模型 / VLM

视觉语言模型、视觉推理、视觉问答、图文理解和视觉 grounding。

共收录 5058 信号源:cs.CV, cs.AI, cs.LG

1. VLM训练与架构 5058 篇

2312.04160 2023-12-08 cs.CV 57%

Text as Image: Learning Transferable Adapter for Multi-Label Classification

Xuelin Zhu, Jiuxin Cao, Jian liu, Dongqi Tang, Furong Xu, Weijia Liu, Jiawei Ge, Bo Liu, Qingpei Guo, Tianyi Zhang

专题命中 VLM训练与架构 :vision-language model(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2310.13355 2023-12-08 cs.CV 57%

SILC: Improving Vision Language Pretraining with Self-Distillation

Muhammad Ferjad Naeem, Yongqin Xian, Xiaohua Zhai, Lukas Hoyer, Luc Van Gool, Federico Tombari

专题命中 VLM训练与架构 :visual question answering(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2311.18445 2023-12-01 cs.CV 57%

VTimeLLM: Empower LLM to Grasp Video Moments

Bin Huang, Xin Wang, Hong Chen, Zihan Song, Wenwu Zhu

专题命中 VLM训练与架构 :grounding(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2311.18273 2023-12-01 cs.CV cs.MM 57%

HKUST at SemEval-2023 Task 1: Visual Word Sense Disambiguation with Context Augmentation and Visual Assistance

Zhuohao Yin, Xin Huang

专题命中 VLM训练与架构 :vision-language model(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2311.07574 2023-11-30 cs.CV 57%

To See is to Believe: Prompting GPT-4V for Better Visual Instruction Tuning

Junke Wang, Lingchen Meng, Zejia Weng, Bo He, Zuxuan Wu, Yu-Gang Jiang

专题命中 VLM训练与架构 :LLaVA(abstract);分类 cs.CV

Comments techical report; work in progress

详情

展开后加载摘要…

URL PDF HTML 收藏
2311.12793 2023-11-29 cs.CV 57%

ShareGPT4V: Improving Large Multi-Modal Models with Better Captions

Lin Chen, Jinsong Li, Xiaoyi Dong, Pan Zhang, Conghui He, Jiaqi Wang, Feng Zhao, Dahua Lin

专题命中 VLM训练与架构 :LLaVA(abstract);分类 cs.CV

Comments Project: https://ShareGPT4V.github.io

详情

展开后加载摘要…

URL PDF HTML 收藏
2309.02301 2023-11-27 cs.CV 57%

CIEM: Contrastive Instruction Evaluation Method for Better Instruction Tuning

Hongyu Hu, Jiyuan Zhang, Minyi Zhao, Zhenbang Sun

专题命中 VLM训练与架构 :vision-language model(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2311.08213 2023-11-15 cs.CV cs.CL 57%

Unlock the Power: Competitive Distillation for Multi-Modal Large Language Models

Xinwei Li, Li Lin, Shuai Wang, Chen Qian

专题命中 VLM训练与架构 :LLaVA(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2306.06687 2023-11-07 cs.CV 57%

LAMM: Language-Assisted Multi-Modal Instruction-Tuning Dataset, Framework, and Benchmark

Zhenfei Yin, Jiong Wang, Jianjian Cao, Zhelun Shi, Dingning Liu, Mukai Li, Lu Sheng, Lei Bai, Xiaoshui Huang, Zhiyong Wang, Jing Shao, Wanli Ouyang

专题命中 VLM训练与架构 :MLLM(abstract);分类 cs.CV

Comments NeurIPS2023 camera ready ; 37 pages, 33 figures. Code available at https://github.com/OpenLAMM/LAMM ; Project page: https://openlamm.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2311.02126 2023-11-07 cs.CV 57%

PILL: Plug Into LLM with Adapter Expert and Attention Gate

Fangyuan Zhang, Tingting Liang, Zhengyuan Wu, Yuyu Yin

专题命中 VLM训练与架构 :vision language model(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2310.16754 2023-10-31 cs.CV 57%

CAD -- Contextual Multi-modal Alignment for Dynamic AVQA

Asmar Nadeem, Adrian Hilton, Robert Dawes, Graham Thomas, Armin Mustafa

专题命中 VLM训练与架构 :visual question answering(abstract);分类 cs.CV

Comments Accepted to IEEE/CVF Winter Conference on Applications of Computer Vision (WACV) 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2309.13847 2023-10-27 cs.CV 57%

Tuning Multi-mode Token-level Prompt Alignment across Modalities

Dongsheng Wang, Miaoge Li, Xinyang Liu, MingSheng Xu, Bo Chen, Hanwang Zhang

专题命中 VLM训练与架构 :vision-language model(abstract);分类 cs.CV

Comments In Proceedings of NeurIPS2023

详情

展开后加载摘要…

URL PDF HTML 收藏
2304.10592 2023-10-03 cs.CV 57%

MiniGPT-4: Enhancing Vision-Language Understanding with Advanced Large Language Models

Deyao Zhu, Jun Chen, Xiaoqian Shen, Xiang Li, Mohamed Elhoseiny

专题命中 VLM训练与架构 :vision-language model(abstract);分类 cs.CV

Comments Project Website: https://minigpt-4.github.io/; Code, Pretrained Model, and Dataset: https://github.com/Vision-CAIR/MiniGPT-4; Deyao Zhu and Jun Chen contributed equally to this work

详情

展开后加载摘要…

URL PDF HTML 收藏
2309.06809 2023-09-14 cs.CV 57%

TAP: Targeted Prompting for Task Adaptive Generation of Textual Training Instances for Visual Classification

M. Jehanzeb Mirza, Leonid Karlinsky, Wei Lin, Horst Possegger, Rogerio Feris, Horst Bischof

专题命中 VLM训练与架构 :VLM(abstract);分类 cs.CV

Comments Code is available at: https://github.com/jmiemirza/TAP

详情

展开后加载摘要…

URL PDF HTML 收藏
2308.01317 2023-09-11 cs.CV eess.IV 57%

ELIXR: Towards a general purpose X-ray artificial intelligence system through alignment of large language models and radiology vision encoders

Shawn Xu, Lin Yang, Christopher Kelly, Marcin Sieniek, Timo Kohlberger, Martin Ma, Wei-Hung Weng, Atilla Kiraly, Sahar Kazemzadeh, Zakkai Melamed, Jungyeon Park, Patricia Strachan, Yun Liu, Chuck Lau, Preeti Singh, Christina Chen, Mozziyar Etemadi, Sreenivasa Raju Kalidindi, Yossi Matias, Katherine Chou, Greg S. Corrado, Shravya Shetty, Daniel Tse, Shruthi Prabhakara, Daniel Golden, Rory Pilgrim, Krish Eswaran, Andrew Sellergren

专题命中 VLM训练与架构 :visual question answering(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2309.01256 2023-09-06 cs.CV cs.CL 57%

BDC-Adapter: Brownian Distance Covariance for Better Vision-Language Reasoning

Yi Zhang, Ce Zhang, Zihan Liao, Yushun Tang, Zhihai He

专题命中 VLM训练与架构 :vision-language model(abstract);分类 cs.CV

Comments Accepted by BMVC 2023

详情

展开后加载摘要…

URL PDF HTML 收藏
2308.06897 2023-08-15 cs.CV cs.MM 57%

Orthogonal Temporal Interpolation for Zero-Shot Video Recognition

Yan Zhu, Junbao Zhuo, Bin Ma, Jiajia Geng, Xiaoming Wei, Xiaolin Wei, Shuhui Wang

专题命中 VLM训练与架构 :vision-language model(abstract);分类 cs.CV

Journal ref Proceedings of the 31st ACM International Conference on Multimedia (MM '23), October 29-November 3, 2023

详情

展开后加载摘要…

URL PDF HTML 收藏
2308.04352 2023-08-09 cs.CV 57%

3D-VisTA: Pre-trained Transformer for 3D Vision and Text Alignment

Ziyu Zhu, Xiaojian Ma, Yixin Chen, Zhidong Deng, Siyuan Huang, Qing Li

专题命中 VLM训练与架构 :grounding(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2307.11315 2023-08-08 cs.CV cs.CL 57%

GIST: Generating Image-Specific Text for Fine-grained Object Classification

Kathleen M. Lewis, Emily Mu, Adrian V. Dalca, John Guttag

专题命中 VLM训练与架构 :vision-language model(abstract);分类 cs.CV

Comments The first two authors contributed equally to this work and are listed in alphabetical order

详情

展开后加载摘要…

URL PDF HTML 收藏
2308.02299 2023-08-07 cs.CV 57%

RegionBLIP: A Unified Multi-modal Pre-training Framework for Holistic and Regional Comprehension

Qiang Zhou, Chaohui Yu, Shaofeng Zhang, Sitong Wu, Zhibing Wang, Fan Wang

专题命中 VLM训练与架构 :MLLM(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2307.09474 2023-07-19 cs.CL cs.CV 57%

ChatSpot: Bootstrapping Multimodal LLMs via Precise Referring Instruction Tuning

Liang Zhao, En Yu, Zheng Ge, Jinrong Yang, Haoran Wei, Hongyu Zhou, Jianjian Sun, Yuang Peng, Runpei Dong, Chunrui Han, Xiangyu Zhang

专题命中 VLM训练与架构 :multimodal large language model(abstract);分类 cs.CV

Comments 15 pages, 8 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2306.12642 2023-06-23 cs.CV 57%

TaCA: Upgrading Your Visual Foundation Model with Task-agnostic Compatible Adapter

Binjie Zhang, Yixiao Ge, Xuyuan Xu, Ying Shan, Mike Zheng Shou

专题命中 VLM训练与架构 :visual question answering(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2212.05171 2023-06-14 cs.CV 57%

ULIP: Learning a Unified Representation of Language, Images, and Point Clouds for 3D Understanding

Le Xue, Mingfei Gao, Chen Xing, Roberto Martín-Martín, Jiajun Wu, Caiming Xiong, Ran Xu, Juan Carlos Niebles, Silvio Savarese

专题命中 VLM训练与架构 :vision-language model(abstract);分类 cs.CV

Comments Accepted by CVPR 2023

详情

展开后加载摘要…

URL PDF HTML 收藏
2303.14302 2023-06-06 cs.CV 57%

VILA: Learning Image Aesthetics from User Comments with Vision-Language Pretraining

Junjie Ke, Keren Ye, Jiahui Yu, Yonghui Wu, Peyman Milanfar, Feng Yang

专题命中 VLM训练与架构 :vision-language model(abstract);分类 cs.CV

Comments CVPR 2023, https://github.com/google-research/google-research/tree/master/vila

详情

展开后加载摘要…

URL PDF HTML 收藏
2305.11439 2023-05-22 cs.CV 57%

Few-Shot Learning with Visual Distribution Calibration and Cross-Modal Distribution Alignment

Runqi Wang, Hao Zheng, Xiaoyue Duan, Jianzhuang Liu, Yuning Lu, Tian Wang, Songcen Xu, Baochang Zhang

专题命中 VLM训练与架构 :vision-language model(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2305.07558 2023-05-15 cs.CL cs.CV 57%

Measuring Progress in Fine-grained Vision-and-Language Understanding

Emanuele Bugliarello, Laurent Sartran, Aishwarya Agrawal, Lisa Anne Hendricks, Aida Nematzadeh

专题命中 VLM训练与架构 :VLM(abstract);分类 cs.CV

Comments ACL 2023

详情

展开后加载摘要…

URL PDF HTML 收藏
2305.07021 2023-05-12 cs.CV 57%

Simple Token-Level Confidence Improves Caption Correctness

Suzanne Petryk, Spencer Whitehead, Joseph E. Gonzalez, Trevor Darrell, Anna Rohrbach, Marcus Rohrbach

专题命中 VLM训练与架构 :vision-language model(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2304.10824 2023-04-24 cs.CV cs.MM 57%

Rethinking Benchmarks for Cross-modal Image-text Retrieval

Weijing Chen, Linli Yao, Qin Jin

专题命中 VLM训练与架构 :VLM(abstract);分类 cs.CV

Comments Accepted to SIGIR2023

详情

展开后加载摘要…

URL PDF HTML 收藏
2304.10311 2023-04-21 cs.MM cs.LG 57%

Movie Box Office Prediction With Self-Supervised and Visually Grounded Pretraining

Qin Chao, Eunsoo Kim, Boyang Li

专题命中 VLM训练与架构 :grounding(abstract);分类 cs.LG

Comments accepted by IEEE International Conference on Multimedia and Expo (2023)

详情

展开后加载摘要…

URL PDF HTML 收藏
2303.11313 2023-04-20 cs.CV 57%

CLIP goes 3D: Leveraging Prompt Tuning for Language Grounded 3D Recognition

Deepti Hegde, Jeya Maria Jose Valanarasu, Vishal M. Patel

专题命中 VLM训练与架构 :vision-language model(abstract);分类 cs.CV

Comments Website: https://jeya-maria-jose.github.io/cg3d-web/

详情

展开后加载摘要…

URL PDF HTML 收藏